{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:BCXC2YRN3XWXHY7VJXUBP3X4P7","short_pith_number":"pith:BCXC2YRN","schema_version":"1.0","canonical_sha256":"08ae2d622ddded73e3f54de817eefc7fd795b8bfe58e2d37d248f1fd775ea452","source":{"kind":"arxiv","id":"2407.19594","version":2},"attestation_state":"computed","paper":{"title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Jason Weston, Jiantao Jiao, Jing Xu, Olga Golovneva, Sainbayar Sukhbaatar, Tianhao Wu, Weizhe Yuan, Yuandong Tian","submitted_at":"2024-07-28T21:58:28Z","abstract_excerpt":"Large Language Models (LLMs) are rapidly surpassing human knowledge in many domains. While improving these models traditionally relies on costly human data, recent self-rewarding mechanisms (Yuan et al., 2024) have shown that LLMs can improve by judging their own responses instead of relying on human labelers. However, existing methods have primarily focused on improving model responses rather than judgment capabilities, resulting in rapid saturation during iterative training. To address this issue, we introduce a novel Meta-Rewarding step to the self-improvement process, where the model judge"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.19594","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-07-28T21:58:28Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"c4765d60a4750e9915353b629b743d1784e91eeb58c3f6c845b6bc70f79cf3e2","abstract_canon_sha256":"042f2af102c348bf0a91a57b226a10980cb60755d9056f05e05672a6eb8fc572"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:49:54.484689Z","signature_b64":"/8nSoUjNKYbizfGAjsf2MqjfY0iJ5Y0De/Q3+yrh8GRr7o3jIfZ8blKbEqfg2wIzCiK7wClyGXSYVtb40mxtAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"08ae2d622ddded73e3f54de817eefc7fd795b8bfe58e2d37d248f1fd775ea452","last_reissued_at":"2026-07-05T08:49:54.484226Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:49:54.484226Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Jason Weston, Jiantao Jiao, Jing Xu, Olga Golovneva, Sainbayar Sukhbaatar, Tianhao Wu, Weizhe Yuan, Yuandong Tian","submitted_at":"2024-07-28T21:58:28Z","abstract_excerpt":"Large Language Models (LLMs) are rapidly surpassing human knowledge in many domains. While improving these models traditionally relies on costly human data, recent self-rewarding mechanisms (Yuan et al., 2024) have shown that LLMs can improve by judging their own responses instead of relying on human labelers. However, existing methods have primarily focused on improving model responses rather than judgment capabilities, resulting in rapid saturation during iterative training. To address this issue, we introduce a novel Meta-Rewarding step to the self-improvement process, where the model judge"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.19594","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.19594/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.19594","created_at":"2026-07-05T08:49:54.484286+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.19594v2","created_at":"2026-07-05T08:49:54.484286+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.19594","created_at":"2026-07-05T08:49:54.484286+00:00"},{"alias_kind":"pith_short_12","alias_value":"BCXC2YRN3XWX","created_at":"2026-07-05T08:49:54.484286+00:00"},{"alias_kind":"pith_short_16","alias_value":"BCXC2YRN3XWXHY7V","created_at":"2026-07-05T08:49:54.484286+00:00"},{"alias_kind":"pith_short_8","alias_value":"BCXC2YRN","created_at":"2026-07-05T08:49:54.484286+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22873","citing_title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","ref_index":218,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11470","citing_title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","ref_index":264,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00424","citing_title":"Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22873","citing_title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","ref_index":217,"is_internal_anchor":false},{"citing_arxiv_id":"2502.03387","citing_title":"LIMO: Less is More for Reasoning","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23213","citing_title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03993","citing_title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05579","citing_title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","ref_index":254,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22597","citing_title":"Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity","ref_index":30,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7","json":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7.json","graph_json":"https://pith.science/api/pith-number/BCXC2YRN3XWXHY7VJXUBP3X4P7/graph.json","events_json":"https://pith.science/api/pith-number/BCXC2YRN3XWXHY7VJXUBP3X4P7/events.json","paper":"https://pith.science/paper/BCXC2YRN"},"agent_actions":{"view_html":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7","download_json":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7.json","view_paper":"https://pith.science/paper/BCXC2YRN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.19594&json=true","fetch_graph":"https://pith.science/api/pith-number/BCXC2YRN3XWXHY7VJXUBP3X4P7/graph.json","fetch_events":"https://pith.science/api/pith-number/BCXC2YRN3XWXHY7VJXUBP3X4P7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7/action/storage_attestation","attest_author":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7/action/author_attestation","sign_citation":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7/action/citation_signature","submit_replication":"https://pith.science/pith/BCXC2YRN3XWXHY7VJXUBP3X4P7/action/replication_record"}},"created_at":"2026-07-05T08:49:54.484286+00:00","updated_at":"2026-07-05T08:49:54.484286+00:00"}