{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:IHVWNFHOIXTTKNZTEJPQ2GRYVJ","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"b47c55c1039f39ad3f6b35eea5baabbec760ff153e73cc7ecbe99eacb6bef1e9","cross_cats_sorted":["cs.AI","cs.CL"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-20T17:16:44Z","title_canon_sha256":"cc3de93324b2cd6e74f2a7b63959799556d6cc4c6ee485f2c332b43b8404de9f"},"schema_version":"1.0","source":{"id":"2505.14625","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.14625","created_at":"2026-07-05T11:07:25Z"},{"alias_kind":"arxiv_version","alias_value":"2505.14625v2","created_at":"2026-07-05T11:07:25Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.14625","created_at":"2026-07-05T11:07:25Z"},{"alias_kind":"pith_short_12","alias_value":"IHVWNFHOIXTT","created_at":"2026-07-05T11:07:25Z"},{"alias_kind":"pith_short_16","alias_value":"IHVWNFHOIXTTKNZT","created_at":"2026-07-05T11:07:25Z"},{"alias_kind":"pith_short_8","alias_value":"IHVWNFHO","created_at":"2026-07-05T11:07:25Z"}],"graph_snapshots":[{"event_id":"sha256:52ab87db088c26f1d679344b3227aa637e9e5eefb02ce7c186e4caba91ac0377","target":"graph","created_at":"2026-07-05T11:07:25Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2505.14625/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement Learning (RL) has become a powerful tool for enhancing the reasoning abilities of large language models (LLMs) by optimizing their policies with reward signals. Yet, RL's success relies on the reliability of rewards, which are provided by verifiers. In this paper, we expose and analyze a widespread problem--false negatives--where verifiers wrongly reject correct model outputs. Our in-depth study of the Big-Math-RL-Verified dataset reveals that over 38% of model-generated responses suffer from false negatives, where the verifier fails to recognize correct answers. We show, both em","authors_text":"Bhaskar Ramasubramanian, Bill Yuchen Lin, Fengqing Jiang, Luyao Niu, Radha Poovendran, Yuetai Li, Zhangchen Xu","cross_cats":["cs.AI","cs.CL"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.14625","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:495da1ea7aa8fd75e51026b40c3b1fd5f9061eef3f5415687b848d1ebbf8a8e2","target":"record","created_at":"2026-07-05T11:07:25Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"b47c55c1039f39ad3f6b35eea5baabbec760ff153e73cc7ecbe99eacb6bef1e9","cross_cats_sorted":["cs.AI","cs.CL"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-20T17:16:44Z","title_canon_sha256":"cc3de93324b2cd6e74f2a7b63959799556d6cc4c6ee485f2c332b43b8404de9f"},"schema_version":"1.0","source":{"id":"2505.14625","kind":"arxiv","version":2}},"canonical_sha256":"41eb6694ee45e7353733225f0d1a38aa69af8de19f2ec3bb63176eaa646badc4","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"41eb6694ee45e7353733225f0d1a38aa69af8de19f2ec3bb63176eaa646badc4","first_computed_at":"2026-07-05T11:07:25.347156Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:07:25.347156Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"y3nCS93TT0/w3Lum1Abxo6aLH9OFNlo27zaDZK7ulZcqzZUAYvqQXm1dKw7jRH6KgsC/hzpoQiG5kYGZShPQCQ==","signature_status":"signed_v1","signed_at":"2026-07-05T11:07:25.347633Z","signed_message":"canonical_sha256_bytes"},"source_id":"2505.14625","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:495da1ea7aa8fd75e51026b40c3b1fd5f9061eef3f5415687b848d1ebbf8a8e2","sha256:52ab87db088c26f1d679344b3227aa637e9e5eefb02ce7c186e4caba91ac0377"],"state_sha256":"7cec8430a9dc598bb390298e07c57f739e12c13cf941050bcd9af33b7f6fb87a"}