{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2026:CM2VBZ5KX5JGVW3WXR7IAFUI23","short_pith_number":"pith:CM2VBZ5K","canonical_record":{"source":{"id":"2607.28026","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-30T11:14:11Z","cross_cats_sorted":[],"title_canon_sha256":"a3e6d7b7ff3aa815bce4a683753b8b78ad812685f0dc4f0a63073f024bb4dba7","abstract_canon_sha256":"e2781cf14d21725cbe3e8a1e3e2e0cb0480ac4a9e9dd5d0544c1b589dc3b9d53"},"schema_version":"1.0"},"canonical_sha256":"133550e7aabf526adb76bc7e801688d6cef95f5ff3ec6ca6e27ac7d037bb2a88","source":{"kind":"arxiv","id":"2607.28026","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2607.28026","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"arxiv_version","alias_value":"2607.28026v1","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.28026","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"pith_short_12","alias_value":"CM2VBZ5KX5JG","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"pith_short_16","alias_value":"CM2VBZ5KX5JGVW3W","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"pith_short_8","alias_value":"CM2VBZ5K","created_at":"2026-07-31T01:35:25Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2026:CM2VBZ5KX5JGVW3WXR7IAFUI23","target":"record","payload":{"canonical_record":{"source":{"id":"2607.28026","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-30T11:14:11Z","cross_cats_sorted":[],"title_canon_sha256":"a3e6d7b7ff3aa815bce4a683753b8b78ad812685f0dc4f0a63073f024bb4dba7","abstract_canon_sha256":"e2781cf14d21725cbe3e8a1e3e2e0cb0480ac4a9e9dd5d0544c1b589dc3b9d53"},"schema_version":"1.0"},"canonical_sha256":"133550e7aabf526adb76bc7e801688d6cef95f5ff3ec6ca6e27ac7d037bb2a88","receipt":{"kind":"pith_receipt","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"133550e7aabf526adb76bc7e801688d6cef95f5ff3ec6ca6e27ac7d037bb2a88","last_reissued_at":"2026-07-31T01:35:25.505672Z","signature_status":"unsigned_v0","first_computed_at":"2026-07-31T01:35:25.505672Z"},"source_kind":"arxiv","source_id":"2607.28026","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-31T01:35:25Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"RCgEE4/Fs3BKy5tkIIcq4gAz7yI+G92JWChi0R5echv5ftqMrGjzr1XDJ2vQCJ+vFUVEQADnbUEZoIXER7L7DQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-01T23:14:30.776384Z"},"content_sha256":"8239d370723849059b2dec5435f1db673811df6663764b7fe42ecd5be78a9811","schema_version":"1.0","event_id":"sha256:8239d370723849059b2dec5435f1db673811df6663764b7fe42ecd5be78a9811"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2026:CM2VBZ5KX5JGVW3WXR7IAFUI23","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Jianing Wang, Junlin Liu, Linsen Guo, Xiaoyu Li, Xingchen Liu, Xingjian Wu, Xuezhi Cao, Xuhang Zhu, Xunliang Cai","submitted_at":"2026-07-30T11:14:11Z","abstract_excerpt":"Recent advances in post-training Large Language Models (LLMs) increasingly rely on Reinforcement Learning with Verifiable Rewards (RLVR) or On-Policy Self-Distillation (OPSD). While OPSD provides dense, logit-level supervision, it inherently suffers from exposure bias due to the privileged information of the self-teacher. In multi-turn agentic settings, this leads to reasoning route convergence and the loss of clear optimization directions. To tackle these challenges, we introduce Contrastive Reinforced Policy Optimization (CRPO), which reformulates agentic OPSD from a contrastive learning per"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.28026","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.28026/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-31T01:35:25Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"4v7yV73HKmGuEdHdIDII+pTRnp7/4F+DxzywKbhBHkZq8BohMMwzTUwRBXn/Y7xcpjz5b9GmzsZ4hNUZ68xvDg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-01T23:14:30.776692Z"},"content_sha256":"52f9b4197f697e577093d462c1d5d31f5fe61f3bfc3a7e9db46535e57d005c60","schema_version":"1.0","event_id":"sha256:52f9b4197f697e577093d462c1d5d31f5fe61f3bfc3a7e9db46535e57d005c60"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23/bundle.json","state_url":"https://pith.science/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-01T23:14:30Z","links":{"resolver":"https://pith.science/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23","bundle":"https://pith.science/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23/bundle.json","state":"https://pith.science/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23/state.json","well_known_bundle":"https://pith.science/.well-known/pith/CM2VBZ5KX5JGVW3WXR7IAFUI23/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2026:CM2VBZ5KX5JGVW3WXR7IAFUI23","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"e2781cf14d21725cbe3e8a1e3e2e0cb0480ac4a9e9dd5d0544c1b589dc3b9d53","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-30T11:14:11Z","title_canon_sha256":"a3e6d7b7ff3aa815bce4a683753b8b78ad812685f0dc4f0a63073f024bb4dba7"},"schema_version":"1.0","source":{"id":"2607.28026","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2607.28026","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"arxiv_version","alias_value":"2607.28026v1","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.28026","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"pith_short_12","alias_value":"CM2VBZ5KX5JG","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"pith_short_16","alias_value":"CM2VBZ5KX5JGVW3W","created_at":"2026-07-31T01:35:25Z"},{"alias_kind":"pith_short_8","alias_value":"CM2VBZ5K","created_at":"2026-07-31T01:35:25Z"}],"graph_snapshots":[{"event_id":"sha256:52f9b4197f697e577093d462c1d5d31f5fe61f3bfc3a7e9db46535e57d005c60","target":"graph","created_at":"2026-07-31T01:35:25Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2607.28026/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Recent advances in post-training Large Language Models (LLMs) increasingly rely on Reinforcement Learning with Verifiable Rewards (RLVR) or On-Policy Self-Distillation (OPSD). While OPSD provides dense, logit-level supervision, it inherently suffers from exposure bias due to the privileged information of the self-teacher. In multi-turn agentic settings, this leads to reasoning route convergence and the loss of clear optimization directions. To tackle these challenges, we introduce Contrastive Reinforced Policy Optimization (CRPO), which reformulates agentic OPSD from a contrastive learning per","authors_text":"Jianing Wang, Junlin Liu, Linsen Guo, Xiaoyu Li, Xingchen Liu, Xingjian Wu, Xuezhi Cao, Xuhang Zhu, Xunliang Cai","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.28026","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:8239d370723849059b2dec5435f1db673811df6663764b7fe42ecd5be78a9811","target":"record","created_at":"2026-07-31T01:35:25Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"e2781cf14d21725cbe3e8a1e3e2e0cb0480ac4a9e9dd5d0544c1b589dc3b9d53","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2026-07-30T11:14:11Z","title_canon_sha256":"a3e6d7b7ff3aa815bce4a683753b8b78ad812685f0dc4f0a63073f024bb4dba7"},"schema_version":"1.0","source":{"id":"2607.28026","kind":"arxiv","version":1}},"canonical_sha256":"133550e7aabf526adb76bc7e801688d6cef95f5ff3ec6ca6e27ac7d037bb2a88","receipt":{"builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"133550e7aabf526adb76bc7e801688d6cef95f5ff3ec6ca6e27ac7d037bb2a88","first_computed_at":"2026-07-31T01:35:25.505672Z","kind":"pith_receipt","last_reissued_at":"2026-07-31T01:35:25.505672Z","receipt_version":"0.3","signature_status":"unsigned_v0"},"source_id":"2607.28026","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:8239d370723849059b2dec5435f1db673811df6663764b7fe42ecd5be78a9811","sha256:52f9b4197f697e577093d462c1d5d31f5fe61f3bfc3a7e9db46535e57d005c60"],"state_sha256":"3751301da92f4f03ee932ec01cf37c7a2c5908da15423eeb727b86ed083fd005"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"UNZ32PA6UREkqKXJ4Q2RiZYdRl9KXLNU5q0pllXsi3JJ6c9ltq4Wl82DcPjhaNw5XNalRXMuhewR++U8lDsSBA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-01T23:14:30.779134Z","bundle_sha256":"4a31394d216ec53f47bf2b126be24b79f123ca3b24d9a378cd48c8dbcd598286"}}