{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:RZV247E7VMX5O47XNLHYPWCGSF","short_pith_number":"pith:RZV247E7","schema_version":"1.0","canonical_sha256":"8e6bae7c9fab2fd773f76acf87d846917364787496d10c935325d03a0d1cab61","source":{"kind":"arxiv","id":"2607.26358","version":1},"attestation_state":"computed","paper":{"title":"Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.GT"],"primary_cat":"cs.LG","authors_text":"Brian W. Lee, Ian Waudby-Smith, Keegan Harris, Michael I. Jordan, Nika Haghtalab, Philip Amortila","submitted_at":"2026-07-29T00:19:09Z","abstract_excerpt":"Reinforcement learning (RL) fine-tuning is widely used in language model training to improve model performance on a target task while limiting drift from a reference policy. A standard way to balance this trade-off is via a KL-regularized RL objective, although this formulation does not by itself provide a principled way to set the regularization coefficient. In practice, the coefficient is typically chosen heuristically or via hyperparameter search, which can lead to unnecessary overhead in training cost or undesirable reward-retention trade-offs. We instead propose a game-theoretic framework"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.26358","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2026-07-29T00:19:09Z","cross_cats_sorted":["cs.AI","cs.GT"],"title_canon_sha256":"f90122553d6647370be0430f0b5428ddafbf172b595b314be91277c74bf213e2","abstract_canon_sha256":"237c38b4a9a7be39020e29a25e444699f40f18dcc7cc542e592373a0c074ab39"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8e6bae7c9fab2fd773f76acf87d846917364787496d10c935325d03a0d1cab61","last_reissued_at":"2026-07-30T01:18:11.802139Z","signature_status":"unsigned_v0","first_computed_at":"2026-07-30T01:18:11.802139Z"},"graph_snapshot":{"paper":{"title":"Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.GT"],"primary_cat":"cs.LG","authors_text":"Brian W. Lee, Ian Waudby-Smith, Keegan Harris, Michael I. Jordan, Nika Haghtalab, Philip Amortila","submitted_at":"2026-07-29T00:19:09Z","abstract_excerpt":"Reinforcement learning (RL) fine-tuning is widely used in language model training to improve model performance on a target task while limiting drift from a reference policy. A standard way to balance this trade-off is via a KL-regularized RL objective, although this formulation does not by itself provide a principled way to set the regularization coefficient. In practice, the coefficient is typically chosen heuristically or via hyperparameter search, which can lead to unnecessary overhead in training cost or undesirable reward-retention trade-offs. We instead propose a game-theoretic framework"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.26358","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.26358/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.26358","created_at":"2026-07-30T01:18:11.807352+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.26358v1","created_at":"2026-07-30T01:18:11.807352+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.26358","created_at":"2026-07-30T01:18:11.807352+00:00"},{"alias_kind":"pith_short_12","alias_value":"RZV247E7VMX5","created_at":"2026-07-30T01:18:11.807352+00:00"},{"alias_kind":"pith_short_16","alias_value":"RZV247E7VMX5O47X","created_at":"2026-07-30T01:18:11.807352+00:00"},{"alias_kind":"pith_short_8","alias_value":"RZV247E7","created_at":"2026-07-30T01:18:11.807352+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF","json":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF.json","graph_json":"https://pith.science/api/pith-number/RZV247E7VMX5O47XNLHYPWCGSF/graph.json","events_json":"https://pith.science/api/pith-number/RZV247E7VMX5O47XNLHYPWCGSF/events.json","paper":"https://pith.science/paper/RZV247E7"},"agent_actions":{"view_html":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF","download_json":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF.json","view_paper":"https://pith.science/paper/RZV247E7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.26358&json=true","fetch_graph":"https://pith.science/api/pith-number/RZV247E7VMX5O47XNLHYPWCGSF/graph.json","fetch_events":"https://pith.science/api/pith-number/RZV247E7VMX5O47XNLHYPWCGSF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF/action/storage_attestation","attest_author":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF/action/author_attestation","sign_citation":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF/action/citation_signature","submit_replication":"https://pith.science/pith/RZV247E7VMX5O47XNLHYPWCGSF/action/replication_record"}},"created_at":"2026-07-30T01:18:11.807352+00:00","updated_at":"2026-07-30T01:18:11.807352+00:00"}