{"as_of":"2026-08-23T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73fe40c032bcc73ce08288fcc4dcb74c575d5cd0f12efd20fbf6b14ab13ae40d","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:36.411682Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17533/citation-record","integrity":"/paper/2506.17533/integrity","json":"/paper/2506.17533/citation-record.json","paper":"/paper/2506.17533"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T23:35:35.483065Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.483065Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:e77f7b72112867c8ceb8ac3275677b5a0c824448188b20c2ee8996ba0a431963","observation_id":"41ab05ea-3da2-47f7-a8c3-c53c66092af6","resolution":{"observed_at":"2026-08-06T23:35:35.483065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-19T17:57:39.331233Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-06T23:35:35.507985Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.507985Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:0d462d4f2057839975955dfc2c5ae780a1c2f49411d976bf82dcf0d34eccedf7","observation_id":"d64b9b35-f1af-4bd3-9ce1-7878d1d93f5b","resolution":{"observed_at":"2026-08-06T23:35:35.507985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-08-19T15:14:39.153033Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-06T23:35:35.544750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.544750Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:032d9f38086bb8d41afe5a7d05dfd50aa20b31d42dff562feb13d08d63e58c8c","observation_id":"81238a6e-2b0e-48b9-9012-9cd10c027c1c","resolution":{"observed_at":"2026-08-06T23:35:35.544750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15402","last_updated":"2024-06-06T01:58:54Z","snapshot_observed_at":"2026-08-21T12:44:02.863204Z","submitted_at":"2023-09-27T04:53:10Z","title":"Navigate through Enigmatic Labyrinth A Survey of Chain of Thought Reasoning: Advances, Frontiers and Future","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15402","snapshot_observed_at":"2026-08-06T23:35:35.567499Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.567499Z"},"links":{"cited_paper":"/paper/2309.15402","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:c039911c52b9eb1980a0fa3ade66ff5550953d6a8e6c46c56e8d778e389492f6","observation_id":"4a52c34c-84db-4bf4-9755-9fa0e33a6d3d","resolution":{"observed_at":"2026-08-06T23:35:35.567499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:35:35.601535Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.601535Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:2caf046313229dfb82ba9e19c30d897dd41120fef9f92af4c1cfb57904da72a3","observation_id":"68d06ddb-0468-4029-9fe4-fc2d250ae7ef","resolution":{"observed_at":"2026-08-06T23:35:35.601535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:35:35.639595Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.639595Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:5b409cbf6940bbfada3c1d6e6171de4965998e6602fbe60c28b8b5f5e9baaa07","observation_id":"10739e12-f9ee-48a2-a056-224bb4de76e2","resolution":{"observed_at":"2026-08-06T23:35:35.639595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T23:35:35.678037Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.678037Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:fd207e095ac7caa178a15a714692824944fa444a9855f016bdec15d7bb242a2c","observation_id":"720a4782-eba4-43a7-ac84-3231ea75b7a2","resolution":{"observed_at":"2026-08-06T23:35:35.678037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-08-15T05:04:59.720326Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-06T23:35:35.725780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.725780Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:c6e671379aadbb82d429236cbef77cbd26a3b7b1ebfbc751b99e6c1885b7a821","observation_id":"1d7a5eaa-f1a8-42fe-bf64-020f12a41351","resolution":{"observed_at":"2026-08-06T23:35:35.725780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:35:35.751872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.751872Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:1b977b4b0ad6eb56282dd5791dd556c12d5077b52d3db034494463dc04c8d93f","observation_id":"3a7b1593-0cd5-4afa-a5c5-c110cac517ef","resolution":{"observed_at":"2026-08-06T23:35:35.751872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-06T23:35:35.759763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.759763Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:af9d0bc9d17f5dbd68f25ebe2debf5fa124a0c4418dcc009838a10a28aa77330","observation_id":"2656d7cb-e0c5-402f-bb80-5de2452c58f7","resolution":{"observed_at":"2026-08-06T23:35:35.759763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:35.768822Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.768822Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:b6d2db30c75f65488de90de8da3986386fdcd9182e56eb03d18209066d037f54","observation_id":"03448270-1e72-4723-891b-a331e5063da9","resolution":{"observed_at":"2026-08-06T23:35:35.768822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:35.780907Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.780907Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:ef82314876d94f57cb2312300a9297b68eeb4f59f13b841545849be766583ccb","observation_id":"62a4bf07-7775-4597-8813-dd15972aca7f","resolution":{"observed_at":"2026-08-06T23:35:35.780907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:35.784417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.784417Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:d4a9c61dfeabb41e321bbd7993acf4719df564cefe2f5967fc1a68d0517e9295","observation_id":"a7d3a5ce-1b44-4037-8856-4a59efb214bb","resolution":{"observed_at":"2026-08-06T23:35:35.784417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T23:35:35.789430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.789430Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:0506ae077eba15e3ccde63a630518bd2efb5bb1cfea6f4e4bd5aad8fb92c781e","observation_id":"6ec01f6e-1f34-4817-96fa-5ed0a5f76acb","resolution":{"observed_at":"2026-08-06T23:35:35.789430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-21T11:41:50.405180Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-06T23:35:35.793524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.793524Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:8225f2a9c86e2ceaec5aeb61bbe391ad009b11ef72a07ba160d03432b8a4512d","observation_id":"abef9125-2b0d-482e-9369-b428b999344d","resolution":{"observed_at":"2026-08-06T23:35:35.793524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04293","last_updated":"2024-04-04T08:38:03Z","snapshot_observed_at":"2026-08-16T14:03:42.453272Z","submitted_at":"2024-04-04T08:38:03Z","title":"Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding","version":1},"cited_work":{"arxiv_id":"2404.04293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04293","snapshot_observed_at":"2026-08-06T23:35:38.535709Z","title":"Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding","venue":"cs.CL","work_id":"3a36f685-b3bb-415b-b222-98772774a077","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.798164Z"},"links":{"cited_paper":"/paper/2404.04293","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:b2d57965e271b136eac8f9b911f5931fda63d2a22df12147c90e30493cccb5b9","observation_id":"6e971a98-5922-4918-8cb6-525083fda904","resolution":{"observed_at":"2026-08-06T23:35:38.564837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:35.801629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.801629Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:a4e5c38b2d46d4475dad583b8fb8115cd493e80da97a774334b4cd6df78f899c","observation_id":"eb671bb0-6aa8-41c0-a761-e18225df1bdf","resolution":{"observed_at":"2026-08-06T23:35:35.801629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.594753Z","title":null,"venue":null,"work_id":"d5196c4f-bfc4-47c7-aa7d-f4615fcea6d6","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.807515Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:a3c45296b84cc594e688f91089122f926da3d3878a10b811217e51ac5f84dcaa","observation_id":"36b2294f-7e56-478e-93bf-cf838495dc01","resolution":{"observed_at":"2026-08-06T23:35:39.615578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:35:35.816879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.816879Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:d143772bf968bc2a48811c038e8dc3706349b40ad9f49e9c150a0a1311bbbbfd","observation_id":"de1130a1-afeb-4eb2-8811-9d0c36ee29fa","resolution":{"observed_at":"2026-08-06T23:35:35.816879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.454873Z","title":null,"venue":null,"work_id":"9fc31ce1-d894-414c-89a7-e72d3b1aef14","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.834748Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:fc6a0426d780268a1e5560778ff96a115e18d1bbe0f58e60159cc23335ca083f","observation_id":"62cf131a-8fe0-483a-bded-1171765540df","resolution":{"observed_at":"2026-08-06T23:35:39.487177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.394748Z","title":null,"venue":null,"work_id":"8c7b6424-05fa-48d6-83d3-0794e344960a","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.888675Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:af8da298acae0a3c9f5edb74feb8351ac4c46e40b293aab4799e1dd97282efc3","observation_id":"37d3195f-9ffc-4d6d-b76d-a2436a12b8b3","resolution":{"observed_at":"2026-08-06T23:35:39.414823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06682","last_updated":"2024-10-16T23:19:46Z","snapshot_observed_at":"2026-08-19T05:46:32.206517Z","submitted_at":"2024-05-05T18:56:46Z","title":"Self-Reflection in LLM Agents: Effects on Problem-Solving Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06682","snapshot_observed_at":"2026-08-06T23:35:35.944885Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.944885Z"},"links":{"cited_paper":"/paper/2405.06682","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:2dcb7d3c39f302c041484f3910b414a81f984fcef0b92e78c3d6117e949e0be7","observation_id":"d7d2d4c6-4d02-4a06-8453-ac859996c402","resolution":{"observed_at":"2026-08-06T23:35:35.944885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14532","last_updated":"2024-06-20T17:45:54Z","snapshot_observed_at":"2026-08-21T19:48:32.294469Z","submitted_at":"2024-06-20T17:45:54Z","title":"RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14532","snapshot_observed_at":"2026-08-06T23:35:35.967705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.967705Z"},"links":{"cited_paper":"/paper/2406.14532","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:890e2f0e2636cbf09f00813ab255e182320540a865944c06be21e99c56e21b40","observation_id":"e1279313-417a-47ed-a1a8-01a313703505","resolution":{"observed_at":"2026-08-06T23:35:35.967705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-06T23:35:35.995617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.995617Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:1f1af3dadba026178357707abda81b3a3631acc1cd456e125ac5df7b878a741d","observation_id":"988349bb-edc9-4dde-9e90-5b46c67ce724","resolution":{"observed_at":"2026-08-06T23:35:35.995617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:35:36.030468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.030468Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:30d7a26c4e0a0cfb97a2a540efb698fb25c7278c0ae6c9ad12fb29c63698334c","observation_id":"b1b765de-9231-43d1-80ee-ba10b373c0d2","resolution":{"observed_at":"2026-08-06T23:35:36.030468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T23:35:36.065794Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.065794Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:93d556468f087646c58efd93867c3faf7ca0e063d60af61890d03364ed0e6041","observation_id":"b4958542-339b-4fa8-9173-945add6a594a","resolution":{"observed_at":"2026-08-06T23:35:36.065794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-19T09:52:21.794296Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-06T23:35:36.079485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.079485Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:9230d119630024a01c309527bc61d4bea64c33e17543976a86d3bd67aecefee8","observation_id":"e82a1853-8285-4461-8166-fcdc7998f07b","resolution":{"observed_at":"2026-08-06T23:35:36.079485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-08-19T06:07:48.619594Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-06T23:35:36.084979Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.084979Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:13f0d682e6974b11b7c85fb801c9d12b70f35c5fd61f958af0a1c336a1938016","observation_id":"901ede36-cd7b-492e-a496-01f068123fc7","resolution":{"observed_at":"2026-08-06T23:35:36.084979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.090853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.090853Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:46971aa6db33a8c5be7cbb34e2f9663309097bc9f3520a1e23b8cc9a99504cdf","observation_id":"461889e5-8629-4eeb-b096-1f79bdd524cb","resolution":{"observed_at":"2026-08-06T23:35:36.090853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T23:35:36.097924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.097924Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:3ca034b6725b385aba97fcdf3b8386717342a3ade1e9fd1d405c408765d02939","observation_id":"3c63e26d-c456-4990-a7b7-049a1d1ea470","resolution":{"observed_at":"2026-08-06T23:35:36.097924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.358334Z","title":null,"venue":null,"work_id":"7fbaf524-729e-44bd-b339-d6c3b714fb61","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.117846Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:5e9aa4d4bd550bc8f283da8a384654f6a1abc9b8650bcfbcf47216c34c2bb3a0","observation_id":"6c555cf2-80ac-426f-a5b6-1c650347b6d3","resolution":{"observed_at":"2026-08-06T23:35:39.375548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:35:36.123399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.123399Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:6f17ecdd82538b5541dde4e5537d8d4ec45067586c2c28e2fa226ad121bbc9a9","observation_id":"8ec35155-ec7d-4c13-ae8a-e6c9f64f860f","resolution":{"observed_at":"2026-08-06T23:35:36.123399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-naacl.55","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"bb0aecac-5f77-496c-a693-5884552b39bb","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.146704Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:80b32fdbdb3a0f69525db408a13e5b38447154ab14468ff8dbb1bd93338f1265","observation_id":"e2fe4bf6-d873-41f4-b517-db7e12f85681","resolution":{"observed_at":"2026-08-06T23:35:36.563521Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.241472Z","title":null,"venue":null,"work_id":"517a7057-4da5-49fe-a529-2467123d6b50","year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.167852Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:69d629136fc88d6f4accaa6c04fc47f05b257b99ca0a865c946f0ecf5c60e286","observation_id":"0edfeb99-8766-4a19-b24a-7c9e4350575e","resolution":{"observed_at":"2026-08-06T23:35:39.286735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-08-19T23:32:49.413897Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-06T23:35:36.214815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.214815Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:006b95542f3f38afc4079b614502f3457db23ac9851a68814e916344bfcf7b59","observation_id":"0ed12f59-2c2a-4be0-9baf-e34ad72ae4f7","resolution":{"observed_at":"2026-08-06T23:35:36.214815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-06T23:35:36.257590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.257590Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:6d7b824ccd2becbb6b32c7df79eb60f7e1930d292521794ecb86447184575cfb","observation_id":"25598257-3867-4653-b43a-0808e163a3a8","resolution":{"observed_at":"2026-08-06T23:35:36.257590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14963","last_updated":"2025-03-27T07:08:33Z","snapshot_observed_at":"2026-08-19T00:13:50.863896Z","submitted_at":"2024-04-23T12:16:05Z","title":"Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14963","snapshot_observed_at":"2026-08-06T23:35:36.314813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.314813Z"},"links":{"cited_paper":"/paper/2404.14963","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:aff48cd1f31ed2529a17595e211e471aff06bf04c1fdcf810b84003fb7924e87","observation_id":"bf3d2dc8-ec3f-4f87-a879-840526c9c941","resolution":{"observed_at":"2026-08-06T23:35:36.314813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.364845Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.364845Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:cc91eab33ee1ba0832e435dba5eaea4ef656fd9fa052216e3e59ac20d650fdd6","observation_id":"c310e405-2a45-4796-a435-0df9ae1b9660","resolution":{"observed_at":"2026-08-06T23:35:36.364845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.411682Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:36.411682Z"},"links":{"citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:5362718aac25bf196ae70faa18fb89f624448fcc8c6e392eb34e3b62da645176","observation_id":"5430bc80-ac98-4ed9-a62e-5d5fc9d2bded","resolution":{"observed_at":"2026-08-06T23:35:36.411682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T21:34:17.312242Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.17533."}