{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:JMKC73BBWIBRHRIS7JXGPW7HNG","short_pith_number":"pith:JMKC73BB","schema_version":"1.0","canonical_sha256":"4b142fec21b20313c512fa6e67dbe769bf89aa863fea0e7955d996a99e2a49bd","source":{"kind":"arxiv","id":"2502.11520","version":1},"attestation_state":"computed","paper":{"title":"AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bin Li, Chao Qu, Dakuan Lu, Haozhe Wang, Minghao Yang, Tianchu Yao, Wei Chu, Xiaoyu Tan, Xihe Qiu, Yinghui Xu, Yuan Qi","submitted_at":"2025-02-17T07:41:27Z","abstract_excerpt":"The reasoning capabilities of advanced large language models (LLMs) like o1 have revolutionized artificial intelligence applications. Nevertheless, evaluating and optimizing complex reasoning processes remain significant challenges due to diverse policy distributions and the inherent limitations of human effort and accuracy. In this paper, we present AURORA, a novel automated framework for training universal process reward models (PRMs) using ensemble prompting and reverse verification. The framework employs a two-phase approach: First, it uses diverse prompting strategies and ensemble methods"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.11520","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-02-17T07:41:27Z","cross_cats_sorted":[],"title_canon_sha256":"94fcb068a3baaab9a431a84e96b1f4b3f3fc129ecc9fd4ffc7c564204c3c5234","abstract_canon_sha256":"83e6c0f8f45e6d6ee401a4d72450997a5d4dc40dbd537a65e7c04daf7f958f9a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:15:30.220129Z","signature_b64":"fefdzeVQKIc66NKroLYElcFPw2eL/WAVa1lGh3OfPIqBagjIFwbH2xsVEI5T2B0v76cjt4/JUEld4CVrBnUFBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4b142fec21b20313c512fa6e67dbe769bf89aa863fea0e7955d996a99e2a49bd","last_reissued_at":"2026-07-05T10:15:30.219627Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:15:30.219627Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bin Li, Chao Qu, Dakuan Lu, Haozhe Wang, Minghao Yang, Tianchu Yao, Wei Chu, Xiaoyu Tan, Xihe Qiu, Yinghui Xu, Yuan Qi","submitted_at":"2025-02-17T07:41:27Z","abstract_excerpt":"The reasoning capabilities of advanced large language models (LLMs) like o1 have revolutionized artificial intelligence applications. Nevertheless, evaluating and optimizing complex reasoning processes remain significant challenges due to diverse policy distributions and the inherent limitations of human effort and accuracy. In this paper, we present AURORA, a novel automated framework for training universal process reward models (PRMs) using ensemble prompting and reverse verification. The framework employs a two-phase approach: First, it uses diverse prompting strategies and ensemble methods"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.11520","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.11520/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.11520","created_at":"2026-07-05T10:15:30.219689+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.11520v1","created_at":"2026-07-05T10:15:30.219689+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.11520","created_at":"2026-07-05T10:15:30.219689+00:00"},{"alias_kind":"pith_short_12","alias_value":"JMKC73BBWIBR","created_at":"2026-07-05T10:15:30.219689+00:00"},{"alias_kind":"pith_short_16","alias_value":"JMKC73BBWIBRHRIS","created_at":"2026-07-05T10:15:30.219689+00:00"},{"alias_kind":"pith_short_8","alias_value":"JMKC73BB","created_at":"2026-07-05T10:15:30.219689+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.01203","citing_title":"GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08281","citing_title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG","json":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG.json","graph_json":"https://pith.science/api/pith-number/JMKC73BBWIBRHRIS7JXGPW7HNG/graph.json","events_json":"https://pith.science/api/pith-number/JMKC73BBWIBRHRIS7JXGPW7HNG/events.json","paper":"https://pith.science/paper/JMKC73BB"},"agent_actions":{"view_html":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG","download_json":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG.json","view_paper":"https://pith.science/paper/JMKC73BB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.11520&json=true","fetch_graph":"https://pith.science/api/pith-number/JMKC73BBWIBRHRIS7JXGPW7HNG/graph.json","fetch_events":"https://pith.science/api/pith-number/JMKC73BBWIBRHRIS7JXGPW7HNG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG/action/storage_attestation","attest_author":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG/action/author_attestation","sign_citation":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG/action/citation_signature","submit_replication":"https://pith.science/pith/JMKC73BBWIBRHRIS7JXGPW7HNG/action/replication_record"}},"created_at":"2026-07-05T10:15:30.219689+00:00","updated_at":"2026-07-05T10:15:30.219689+00:00"}