{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:MURRQ7E7MFITX7SSXY4IXZAUDL","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"8dfa62e1dac985fcd404c1c6ed1d76156ed71e011f6d0f74acabd2f99993731e","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-20T17:59:52Z","title_canon_sha256":"6b8d74f1b4dc4771eb1d63a620885501ef5467749fdf6a21656873a9f65d9777"},"schema_version":"1.0","source":{"id":"2506.17219","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2506.17219","created_at":"2026-07-05T11:26:53Z"},{"alias_kind":"arxiv_version","alias_value":"2506.17219v2","created_at":"2026-07-05T11:26:53Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.17219","created_at":"2026-07-05T11:26:53Z"},{"alias_kind":"pith_short_12","alias_value":"MURRQ7E7MFIT","created_at":"2026-07-05T11:26:53Z"},{"alias_kind":"pith_short_16","alias_value":"MURRQ7E7MFITX7SS","created_at":"2026-07-05T11:26:53Z"},{"alias_kind":"pith_short_8","alias_value":"MURRQ7E7","created_at":"2026-07-05T11:26:53Z"}],"graph_snapshots":[{"event_id":"sha256:92175c011dcf0612b141fcf93ffd51f521958b4f29b306d24e9c4e1560bab1d8","target":"graph","created_at":"2026-07-05T11:26:53Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2506.17219/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement learning has emerged as a powerful paradigm for post-training large language models (LLMs) to improve reasoning. Approaches like Reinforcement Learning from Human Feedback (RLHF) and Reinforcement Learning with Verifiable Rewards (RLVR) have shown strong results, but they require extensive external supervision. We investigate an alternative class of methods, Reinforcement Learning from Internal Feedback (RLIF), which relies solely on intrinsic model-derived signals instead of external rewards. In particular, we leverage unsupervised reward proxies such as token-level entropy, tra","authors_text":"Chen Wang, Haoxiang Guan, Jiyan He, Shuxin Zheng, Yanzhi Zhang, Yilin Cheng, Yitong Duan, Yue Wang, Zhaoxi Zhang","cross_cats":["cs.AI"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.17219","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:d7a7e980686199ca96d55a56afcfe0dcaff1c1529fa867e962a147e27c972941","target":"record","created_at":"2026-07-05T11:26:53Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"8dfa62e1dac985fcd404c1c6ed1d76156ed71e011f6d0f74acabd2f99993731e","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-20T17:59:52Z","title_canon_sha256":"6b8d74f1b4dc4771eb1d63a620885501ef5467749fdf6a21656873a9f65d9777"},"schema_version":"1.0","source":{"id":"2506.17219","kind":"arxiv","version":2}},"canonical_sha256":"6523187c9f61513bfe52be388be4141acc9fb012c08e14683b0a7310159e4346","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"6523187c9f61513bfe52be388be4141acc9fb012c08e14683b0a7310159e4346","first_computed_at":"2026-07-05T11:26:53.204077Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:26:53.204077Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"KagncusLy9A4U8FW1vH6JhQc3y2/rVJdYcuvhDO6XVGEqW81Dsqi/zvOhjrAraKPE4JNJhiqo9u/Jlhdh/zmDQ==","signature_status":"signed_v1","signed_at":"2026-07-05T11:26:53.204550Z","signed_message":"canonical_sha256_bytes"},"source_id":"2506.17219","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:d7a7e980686199ca96d55a56afcfe0dcaff1c1529fa867e962a147e27c972941","sha256:92175c011dcf0612b141fcf93ffd51f521958b4f29b306d24e9c4e1560bab1d8"],"state_sha256":"2be7986867f10ecd34ea7abf93aad88af6554a354e6ca7b8763f4c91dcf27187"}