{"as_of":"2026-08-20T15:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48a54b9cf13829bd48b3440d3177914be3c35bf90d699277fab2c079be5b9f87","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T04:25:58.525387Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27631/citation-record","integrity":"/paper/2607.27631/integrity","json":"/paper/2607.27631/citation-record.json","paper":"/paper/2607.27631"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T04:25:58.389790Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.389790Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:c9dc1563c7925ccaef8093c5d7d3abb3821244bd39e80cb6a89d17c3af90e477","observation_id":"94fc6800-0383-4a9a-9406-10cb62fc4154","resolution":{"observed_at":"2026-08-01T04:25:58.389790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.395220Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.395220Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:bcb8ca5cc17af8a340775af8e81e8bfadc7fcfbcfb2d9c0c9fbb8c5e66c12261","observation_id":"11aa3ab5-065f-4841-8be9-cec10feae898","resolution":{"observed_at":"2026-08-01T04:25:58.395220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.403577Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.403577Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:77be783e9196612ff38ba3c4dfe7e252e063712f9138247ce8da5b6f63816533","observation_id":"b6b02685-57ca-42e5-81fd-618e2e45eb56","resolution":{"observed_at":"2026-08-01T04:25:58.403577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.410071Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.410071Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:9f9b75d5f01a3efa591cb933dc8a52980ffaebfa8bfdb271fd00c10353ab3276","observation_id":"1415dfd0-8039-4014-8cef-c94c3440276b","resolution":{"observed_at":"2026-08-01T04:25:58.410071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.418278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.418278Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:05303cf1720f61f3f559c828cc2d332cf85fd4d1804d63db89ff2495f5be73eb","observation_id":"415bcdad-a4ba-4ce0-a2e6-c4327eb2f402","resolution":{"observed_at":"2026-08-01T04:25:58.418278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-16T16:18:35.731432Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-01T04:25:58.427179Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.427179Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:92015a13ffd188d0aba4baa6a7b3c929d3add5069aec9d9e2e22ffa183ba2ddb","observation_id":"080504b6-be60-4a7f-bd13-693d2f04e7ed","resolution":{"observed_at":"2026-08-01T04:25:58.427179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.434458Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.434458Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:019b2ee0ba1a73354295724a6c965d815f4d60c174febc10ab1027256ec655c3","observation_id":"dadac0ff-54a1-4995-9923-34c303182304","resolution":{"observed_at":"2026-08-01T04:25:58.434458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.438589Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.438589Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:dbb0709d5ffd6dee912485a6516a1b70097867fab52d3ff71eb6b91c449b2b7f","observation_id":"36791bee-7cdd-4966-826d-d8e22cec4ada","resolution":{"observed_at":"2026-08-01T04:25:58.438589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.442663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.442663Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:421a8e25c761a0b0992d8fa3f7a41d6c64ec9d0e3a9322c1f13cc62a3e0e403a","observation_id":"7a0692ad-3081-499b-ba92-4d35f15881bf","resolution":{"observed_at":"2026-08-01T04:25:58.442663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.448527Z","title":"American Invitational Mathematics Examination (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.448527Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:8b3758e32b5cfe685a4b2e12e9b172927f20042a7a05de457500af54c00e83ca","observation_id":"5e5914aa-1848-4988-a650-852070d4b3c7","resolution":{"observed_at":"2026-08-01T04:25:58.448527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.453289Z","title":"Beyond Benchmarks:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.453289Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:0aae592fe5ae839de93f6494934c61ee48a26f1f9ac88dae17b174fe00915e7d","observation_id":"a6100a88-2741-48f4-b10a-44bcfee09d88","resolution":{"observed_at":"2026-08-01T04:25:58.453289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.457535Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.457535Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:153de005ad59c5d59a73257bddce7ed106ab930f516638b8aa6431c34ac3a7fc","observation_id":"b710147d-453e-4f9f-917b-21b7c7b19717","resolution":{"observed_at":"2026-08-01T04:25:58.457535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.461835Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.461835Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:84e7a426624c4b9cc6c0d9cd474cfdadeb1e04f938f1d2be3c98fb79dc21429e","observation_id":"d162c30f-474a-4001-83bb-745eb97f8d24","resolution":{"observed_at":"2026-08-01T04:25:58.461835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T04:25:58.466055Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.466055Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:a9c1d9c9b47e1116b3ef19d4ba8a35876b1aa0c067c7024ee3c321456b7b5f34","observation_id":"9840e5f1-b2d5-474a-8649-8cf3820879ba","resolution":{"observed_at":"2026-08-01T04:25:58.466055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.470754Z","title":"What's Behind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.470754Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:ff8bbfa237795d4eaeda42df9bd8206f43701dd9f01f748e984ed99f31bea03a","observation_id":"1c9b5c1f-a9fc-43b8-971c-02c8f1f8ac0a","resolution":{"observed_at":"2026-08-01T04:25:58.470754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.475335Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.475335Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:622ed9bd50701c8e49bf249b693c3fe0405827bf202b4368c1f772e114cba0ed","observation_id":"d79fb54c-9dd6-4b02-bea6-037b833cfbd5","resolution":{"observed_at":"2026-08-01T04:25:58.475335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.479494Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.479494Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:10426600f2f954120b08afa849ba1531b66d2da8e3c0827c8405b9f411119a86","observation_id":"998eaf53-b425-4686-a38e-c2398bb982dc","resolution":{"observed_at":"2026-08-01T04:25:58.479494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.483630Z","title":"Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.483630Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:27fb4fc4d18964e405e339668e7370f81b940c71d3065424ec00db4dd12a227e","observation_id":"0e71717c-c66a-4b35-a611-473c576a75f6","resolution":{"observed_at":"2026-08-01T04:25:58.483630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.488391Z","title":"2025 , organization=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.488391Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:7fa1058ac20ce75126d14b59f2410b2ee5f722c75ca84b40d074e1ad06243778","observation_id":"d84d4668-bf93-4c1d-a354-023ebf1b71d3","resolution":{"observed_at":"2026-08-01T04:25:58.488391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.492750Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.492750Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:63cfa5487651c52c2f6353d1135453336207ea8a47ada2211bc9ee6a87b5452f","observation_id":"f99f3219-8f86-4725-a73f-e3e90aa08757","resolution":{"observed_at":"2026-08-01T04:25:58.492750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.497475Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.497475Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:57862e24870e62d9077f315e1fb5b55779642a091ff65344a0d455a1ede0615a","observation_id":"22c37088-bc49-4baf-bdca-5a3618337163","resolution":{"observed_at":"2026-08-01T04:25:58.497475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.501888Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.501888Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:ae18e3f5ad491d8f467acbb58af1edb306f862278bdc01e0c778b7718e6f2c62","observation_id":"fb7744e8-e05c-4ca5-a015-e805f51b09d8","resolution":{"observed_at":"2026-08-01T04:25:58.501888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.506221Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.506221Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:19a49a98565e3ce1d2f0435b32160b3150f93386fc9741839d91c0f9a04f035d","observation_id":"fcca57f4-9d2b-490f-8f82-47ce045ff8d6","resolution":{"observed_at":"2026-08-01T04:25:58.506221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.511028Z","title":"Findings of the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.511028Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:ac837923bda7819bb3efb279d2f2eaab8849160f323edc4c94691b6f8828d82f","observation_id":"ddbd473c-9c00-41c2-a04b-5640bd95ace3","resolution":{"observed_at":"2026-08-01T04:25:58.511028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-08-12T18:00:47.796022Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13217","snapshot_observed_at":"2026-08-01T04:25:58.515880Z","title":"arXiv preprint arXiv:2605.13217 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.515880Z"},"links":{"cited_paper":"/paper/2605.13217","citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:5de6a1891a82c16e09e8a61833daed19c3657e1bee1a0599abe3d75fbfa82738","observation_id":"bcc855fa-c7bf-4e39-ae5a-e33fb562aa6a","resolution":{"observed_at":"2026-08-01T04:25:58.515880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.520583Z","title":"Asymmetric Proximal Policy Optimization: mini-critics boost","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.520583Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:af921e66883bf7fd3d185cf4d357b36062df97132e5c8fa28aaa6704ec16b2f8","observation_id":"4b4ee3c5-ab27-4d6a-9e20-01150f894053","resolution":{"observed_at":"2026-08-01T04:25:58.520583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:25:58.525387Z","title":"Bringing Value Models Back: Generative Critics for Value Modeling in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.525387Z"},"links":{"citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:589396dbb8e66c7c18d5aac8c34b48bd887b1ae2235307563130c7368d2177f7","observation_id":"3fbf67f7-6843-4fe2-82f3-41eabcddffde","resolution":{"observed_at":"2026-08-01T04:25:58.525387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T12:57:37.963478Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.27631."}