{"as_of":"2026-08-07T18:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c564f52db94c3cbce9ddb68522ba23d184e9e4d60f3a7e0146f87cbd38a0273b","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:10:24.550084Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T22:24:41.760120Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T22:25:22.546587Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"cited_work":{"arxiv_id":"2508.05928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05928","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating think-answer mismatch in llm reason- ing through noise-aware advantage reweighting","venue":null,"work_id":"a679ea5a-c752-476c-b299-adfb96cdadbd","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-07-31T14:35:45.739240Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2508.05928","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:b75ab940a8463f8004f635ebee45f6119cd38102cd84f61d793876fc542ebdcc","observation_id":"863b38eb-7988-4991-b28f-6a14df9dd436","resolution":{"observed_at":"2026-05-17T22:25:22.548980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"cited_work":{"arxiv_id":"2508.05928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05928","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating think-answer mismatch in llm reason- ing through noise-aware advantage reweighting","venue":null,"work_id":"a679ea5a-c752-476c-b299-adfb96cdadbd","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2508.05928","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:7257f19d9ad7c1d040f0286586e6a8f7351f6f98e5b4fb0a9580b07da8129802","observation_id":"483e9cc9-cc00-47fe-a3bd-7314640d45a7","resolution":{"observed_at":"2026-05-11T03:55:56.814962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"cited_work":{"arxiv_id":"2508.05928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05928","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating think-answer mismatch in llm reason- ing through noise-aware advantage reweighting","venue":null,"work_id":"a679ea5a-c752-476c-b299-adfb96cdadbd","year":2025},"citing_paper":{"arxiv_id":"2605.10863","last_updated":"2026-05-11T17:10:44Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:10:44Z","title":"DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:31:42.065093Z"},"links":{"cited_paper":"/paper/2508.05928","citing_paper":"/paper/2605.10863"},"observation_digest":"sha256:9d1806622a12f43154470aff66d78ef41fbb1f123e03c63f4d268bfa9a9bc9e7","observation_id":"e77d17ca-0e9c-42ca-9d00-ceef1daa6a5f","resolution":{"observed_at":"2026-05-12T07:16:30.130912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05928/citation-record","integrity":"/paper/2508.05928/integrity","json":"/paper/2508.05928/citation-record.json","paper":"/paper/2508.05928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:24.461471Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn’t","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.461471Z"},"links":{"citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:7fdcb6dd34f940e85c24db10755365f5642ae3c9dcedc4b1cc1d986866c9b3f9","observation_id":"ef0fa1f5-a63c-423d-94a5-c8b7a24b21d8","resolution":{"observed_at":"2026-08-05T23:10:24.461471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:10:24.465211Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.465211Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:e78c80996863d3345f2db6370794749fd62b3573ea5d0da6066bfac9efe3e03c","observation_id":"79ab36ea-c431-47e4-a763-4f9334673b60","resolution":{"observed_at":"2026-08-05T23:10:24.465211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T23:10:24.469058Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.469058Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:28450d6fb489518ee1ac0a7dad1edb6849868867d42c29d1911dea32987e1396","observation_id":"cec1ec34-ebe4-4254-89d9-788162f79dc8","resolution":{"observed_at":"2026-08-05T23:10:24.469058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T23:10:24.480610Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.480610Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:9bf20720e78ad896ae871f4881ac6673daee0815fbb7b7348f3087821682141f","observation_id":"7e1d3b67-3b55-40ea-a6d0-e840fcdd5b6c","resolution":{"observed_at":"2026-08-05T23:10:24.480610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-05T23:10:24.484196Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.484196Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:97eefe8db0351921bdf5622a01e12bcff684dbcd99f6770d2670ac780c36cf39","observation_id":"cb019d9a-d1dc-450b-bf12-b6e2b5bda1ca","resolution":{"observed_at":"2026-08-05T23:10:24.484196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T23:10:24.491071Z","title":"Zettlemoyer, Percy Liang, Emmanuel J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.491071Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:e346f842389d6820bf4b46bbfbff40b8dacb7fba945ff9bbb9ba0d954c1fd349","observation_id":"66eb2392-1fc5-42a5-8587-b2612640d9de","resolution":{"observed_at":"2026-08-05T23:10:24.491071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24709","last_updated":"2025-05-30T15:30:43Z","snapshot_observed_at":"2026-08-07T12:12:53.183544Z","submitted_at":"2025-05-30T15:30:43Z","title":"On Symmetric Losses for Robust Policy Optimization with Noisy Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24709","snapshot_observed_at":"2026-08-05T23:10:24.494910Z","title":"On symmetric losses for robust policy optimization with noisy preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.494910Z"},"links":{"cited_paper":"/paper/2505.24709","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:ae3738fe7c75995cb06222a500414cff6a7a574e3d61c6674f0f845022a9cabc","observation_id":"a284d844-e747-4df6-81cc-0122ea43d495","resolution":{"observed_at":"2026-08-05T23:10:24.494910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T23:10:24.498499Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.498499Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:6ecce34d55389a293e99b5d206eb902c5bd4eb84f5a420d78422efe2819c9a2e","observation_id":"50c28dc4-55a5-4d1d-aa32-733ef375303d","resolution":{"observed_at":"2026-08-05T23:10:24.498499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T23:10:24.505447Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.505447Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:a0f26175485da97581ffd9f4d9c41bac179b65b41de2d9b952b1b377c9620617","observation_id":"116f5781-46de-4288-863f-78557b93c382","resolution":{"observed_at":"2026-08-05T23:10:24.505447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18069","last_updated":"2025-03-23T13:33:59Z","snapshot_observed_at":"2026-08-07T16:43:15.974973Z","submitted_at":"2025-03-23T13:33:59Z","title":"Long Is More Important Than Difficult for Training Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.18069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.18069","snapshot_observed_at":"2026-08-05T23:10:24.691725Z","title":"Long Is More Important Than Difficult for Training Reasoning Models","venue":"cs.CL","work_id":"ddc8d531-27d7-42f4-931e-5ed490b7a647","year":2025},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.509786Z"},"links":{"cited_paper":"/paper/2503.18069","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:1de3409730d40c929e1b1a03aef2f710afb1e338fb4e3461c0a66245896e37eb","observation_id":"ceacfdd0-4f3e-4282-818a-3df7b6b59151","resolution":{"observed_at":"2026-08-05T23:10:24.698575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-07T08:05:38.374743Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-05T23:10:24.513775Z","title":"Prmbench: A fine-grained and challenging benchmark for process-level reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.513775Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:c682da476bad2ecd73bc5328b34e98630667f2116659cdbebb56a18d1612341b","observation_id":"8405bc8a-abd0-4739-b46f-0993e3b2409e","resolution":{"observed_at":"2026-08-05T23:10:24.513775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08516","last_updated":"2024-06-04T10:25:13Z","snapshot_observed_at":"2026-08-01T15:03:20.697877Z","submitted_at":"2023-11-14T20:12:38Z","title":"LLMs cannot find reasoning errors, but can correct them given the error location","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08516","snapshot_observed_at":"2026-08-05T23:10:24.518161Z","title":"Llms cannot find reasoning errors, but can correct them given the error location.arXiv preprint arXiv:2311.08516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.518161Z"},"links":{"cited_paper":"/paper/2311.08516","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:aff2e53f1c9c2c84e62a82a345f0c88fef9715c0255a7e61a6d793b07412fdd7","observation_id":"a27d6a7e-75b1-44b2-8bf6-8669645059d0","resolution":{"observed_at":"2026-08-05T23:10:24.518161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-05T23:10:24.525759Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.525759Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:9f2656c2d79b83dbea4e1f7c7d73b001ee5c5c2182140e09e311db9fcb425ad4","observation_id":"448730c8-885a-4819-9491-e48d9a58ada9","resolution":{"observed_at":"2026-08-05T23:10:24.525759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13210","last_updated":"2024-07-03T00:23:41Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:20:59Z","title":"Bayesian Reward Models for LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13210","snapshot_observed_at":"2026-08-05T23:10:24.529784Z","title":"Bayesian reward models for llm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.529784Z"},"links":{"cited_paper":"/paper/2402.13210","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:6ed78307d88b5b398a132dcf238c0d255bf9a7b5d303af5b8d70d167a30c8abc","observation_id":"7cf9db51-0e08-48f4-90c8-a2c8f098b12a","resolution":{"observed_at":"2026-08-05T23:10:24.529784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-07T12:38:52.756749Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23646","snapshot_observed_at":"2026-08-05T23:10:24.533640Z","title":"Are reasoning models more prone to hallucination? arXiv preprint arXiv:2505.23646 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.533640Z"},"links":{"cited_paper":"/paper/2505.23646","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:266cf6ed2ef0d89165c027fa49ff1d18347f879a5ffd8cd059502914df416f9c","observation_id":"34e2174a-a21a-4f47-bbd6-334613c02e47","resolution":{"observed_at":"2026-08-05T23:10:24.533640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T23:10:24.537866Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.537866Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:c8f58fa8937820197272f1a919321edc4089a52c9743c265a4594863d179f0b1","observation_id":"cf79147b-2448-43ca-946e-05d996526292","resolution":{"observed_at":"2026-08-05T23:10:24.537866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T23:10:24.542099Z","title":"Simplerl- zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.542099Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:63950dd0ca14371bec1be65581ec4e3877b4edcc8af083a629b32068fc850012","observation_id":"681f7375-76b6-4f50-905d-f111fa72d75c","resolution":{"observed_at":"2026-08-05T23:10:24.542099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-05T20:30:49.812919Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-05T23:10:24.546164Z","title":"Processbench: Identifying process errors in mathematical rea- soning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.546164Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:49ee1096a2c725d9db9d88c66bfab9b8c91c2590e46b48df31ef51c10c6a098d","observation_id":"ec5b716e-19b0-4c33-912d-32f541f0a34b","resolution":{"observed_at":"2026-08-05T23:10:24.546164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T23:10:24.550084Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.550084Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:0dc17e6e1e33a4cdb76729cdfc8107a03bebf8a7f8288cf403f78cf27117b4b1","observation_id":"4acf7ad6-eda0-4af7-8c13-6b6d3fab07bd","resolution":{"observed_at":"2026-08-05T23:10:24.550084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-07T15:43:41.219115Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-05T23:10:24.452911Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.452911Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:2cc6b562a0e83f3ab3383fcafae5e495d0546d0d80cab9d0d244be11546696dd","observation_id":"892fbaba-8018-4613-907c-bbe0cdaaa6cc","resolution":{"observed_at":"2026-08-05T23:10:24.452911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T23:10:24.522055Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.522055Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:78a500e5357df56641ec828c0193904ad464838caaedf85887bb48a298035f85","observation_id":"613c89b2-ed73-4a0b-a26a-bf4af8a9ffa5","resolution":{"observed_at":"2026-08-05T23:10:24.522055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T23:10:24.501625Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.501625Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:e735f229711c831c6adc89c211c5803496858bb405419aecc9953bd7519f436a","observation_id":"e6e576f3-303d-4653-9fa9-de1668690b16","resolution":{"observed_at":"2026-08-05T23:10:24.501625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T23:10:24.473186Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.473186Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:2d1d06d4e057bda3f5bb9fe0a79a2551c292dbc664acf1c6dcea260509df87d0","observation_id":"01562e6f-0fbc-41bd-83a2-ea043bec836c","resolution":{"observed_at":"2026-08-05T23:10:24.473186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T23:10:24.477083Z","title":"Step-dpo: Step- wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.477083Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:bb56823436c7b58fa280e4a4c50ca5b297d27927fdb6610c3709e30395d1ce0f","observation_id":"c3f08595-d6ec-47d1-b174-aa944314cf68","resolution":{"observed_at":"2026-08-05T23:10:24.477083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-05T23:10:24.487632Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.487632Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:3d259a414f2a202a7e1a5664d9c2eb43e0b43b26e3bec63eb23ac0eb029affcb","observation_id":"9c4e76e6-c273-4b8b-aa6d-237a889f0858","resolution":{"observed_at":"2026-08-05T23:10:24.487632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T23:10:24.456829Z","title":"The entropy mechanism of reinforcement learning for reasoning language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.456829Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:5bd7019f43acbb97bcbafd83822d14da5c68a1a2508bb9bdf247d3a546784c7b","observation_id":"f0893c3f-5b55-4cad-861a-355f9829a8df","resolution":{"observed_at":"2026-08-05T23:10:24.456829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 3 inbound Pith citation observations for arXiv:2508.05928."}