{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2026:CHN327LEGSZJW6O3ROVPIAQDDH","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"7b9c437c86e6dfb4f9316f074a32f621b3a63005f894d68d78e26c24ffb34b70","cross_cats_sorted":["cs.CL"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2026-07-30T03:42:52Z","title_canon_sha256":"1261b46b43ce34c48d3d2b4ccaed7a528cfa3931912c0a8dd4f07b48c3e47ae1"},"schema_version":"1.0","source":{"id":"2607.27631","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2607.27631","created_at":"2026-07-31T01:28:37Z"},{"alias_kind":"arxiv_version","alias_value":"2607.27631v1","created_at":"2026-07-31T01:28:37Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.27631","created_at":"2026-07-31T01:28:37Z"},{"alias_kind":"pith_short_12","alias_value":"CHN327LEGSZJ","created_at":"2026-07-31T01:28:37Z"},{"alias_kind":"pith_short_16","alias_value":"CHN327LEGSZJW6O3","created_at":"2026-07-31T01:28:37Z"},{"alias_kind":"pith_short_8","alias_value":"CHN327LE","created_at":"2026-07-31T01:28:37Z"}],"graph_snapshots":[{"event_id":"sha256:760b55941a34caab5f9d8c65877dc8f17408ad38f666a12dad9ad37e1df2a32d","target":"graph","created_at":"2026-07-31T01:28:37Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2607.27631/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement learning has emerged as an effective paradigm for enhancing the mathematical reasoning capabilities of large language models. Among existing policy optimization methods, Proximal Policy Optimization (PPO) remains particularly appealing because its learned critic can, in principle, provide token-level credit assignment. However, in mathematical reasoning tasks characterized by long reasoning horizons and sparse outcome rewards, reliable token-level credit assignment remains challenging. The standard critic often fails to accurately evaluate intermediate reasoning states, resulting","authors_text":"Fei Wu, Jianshu Zhang, Jun Du, Si Wei, Zhenrong Zhang","cross_cats":["cs.CL"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.27631","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:8c8fd0d93bfb13ac9c0c82c8fcd127a2a34fa03b9eaa7b547d8f37e0c687a7bb","target":"record","created_at":"2026-07-31T01:28:37Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"7b9c437c86e6dfb4f9316f074a32f621b3a63005f894d68d78e26c24ffb34b70","cross_cats_sorted":["cs.CL"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2026-07-30T03:42:52Z","title_canon_sha256":"1261b46b43ce34c48d3d2b4ccaed7a528cfa3931912c0a8dd4f07b48c3e47ae1"},"schema_version":"1.0","source":{"id":"2607.27631","kind":"arxiv","version":1}},"canonical_sha256":"11dbbd7d6434b29b79db8baaf4020319d4b4e86b08e31ddf4bc278ca665d02c5","receipt":{"builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"11dbbd7d6434b29b79db8baaf4020319d4b4e86b08e31ddf4bc278ca665d02c5","first_computed_at":"2026-07-31T01:28:37.668158Z","kind":"pith_receipt","last_reissued_at":"2026-07-31T01:28:37.668158Z","receipt_version":"0.3","signature_status":"unsigned_v0"},"source_id":"2607.27631","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:8c8fd0d93bfb13ac9c0c82c8fcd127a2a34fa03b9eaa7b547d8f37e0c687a7bb","sha256:760b55941a34caab5f9d8c65877dc8f17408ad38f666a12dad9ad37e1df2a32d"],"state_sha256":"c325800f757766a5732d9d048d64d80d71057137f408c6d452211a1154091311"}