{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:YABZKNAWN4HUTOI4H4LJ5KBJAS","short_pith_number":"pith:YABZKNAW","schema_version":"1.0","canonical_sha256":"c0039534166f0f49b91c3f169ea82904bae2c86b192ebad0b90011eb4e031b76","source":{"kind":"arxiv","id":"2507.09973","version":1},"attestation_state":"computed","paper":{"title":"Tiny Reward Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Sarah Pan","submitted_at":"2025-07-14T06:43:00Z","abstract_excerpt":"Large decoder-based language models have become the dominant architecture for reward modeling in reinforcement learning from human feedback (RLHF). However, as reward models are increasingly deployed in test-time strategies, their inference costs become a growing concern. We present TinyRM, a family of small, bidirectional masked language models (MLMs) with as few as 400 million parameters, that rival the capabilities of models over 175 times larger on reasoning and safety preference modeling tasks. TinyRM combines FLAN-style prompting, Directional Low-Rank Adaptation (DoRA), and layer freezin"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.09973","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-07-14T06:43:00Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"f35af1d25f5891ecf5be09ea081550dc5e0fc632527771b8b7b7807fdb8f51a6","abstract_canon_sha256":"c668121d0383c25fe2283698303dd8bac043038bc6cd1c0e1e7f9a6da6cc7ad1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:36:43.082094Z","signature_b64":"BlYu58LTd+UN3MEtTEIL4M65uMzsTKLK0rRLpRehqFsSUFY1C8fOGEfFDcLfWQi1ko4k/J9N3Hw6nciaOHUyDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c0039534166f0f49b91c3f169ea82904bae2c86b192ebad0b90011eb4e031b76","last_reissued_at":"2026-07-05T11:36:43.081546Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:36:43.081546Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Tiny Reward Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Sarah Pan","submitted_at":"2025-07-14T06:43:00Z","abstract_excerpt":"Large decoder-based language models have become the dominant architecture for reward modeling in reinforcement learning from human feedback (RLHF). However, as reward models are increasingly deployed in test-time strategies, their inference costs become a growing concern. We present TinyRM, a family of small, bidirectional masked language models (MLMs) with as few as 400 million parameters, that rival the capabilities of models over 175 times larger on reasoning and safety preference modeling tasks. TinyRM combines FLAN-style prompting, Directional Low-Rank Adaptation (DoRA), and layer freezin"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.09973","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.09973/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.09973","created_at":"2026-07-05T11:36:43.081607+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.09973v1","created_at":"2026-07-05T11:36:43.081607+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.09973","created_at":"2026-07-05T11:36:43.081607+00:00"},{"alias_kind":"pith_short_12","alias_value":"YABZKNAWN4HU","created_at":"2026-07-05T11:36:43.081607+00:00"},{"alias_kind":"pith_short_16","alias_value":"YABZKNAWN4HUTOI4","created_at":"2026-07-05T11:36:43.081607+00:00"},{"alias_kind":"pith_short_8","alias_value":"YABZKNAW","created_at":"2026-07-05T11:36:43.081607+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS","json":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS.json","graph_json":"https://pith.science/api/pith-number/YABZKNAWN4HUTOI4H4LJ5KBJAS/graph.json","events_json":"https://pith.science/api/pith-number/YABZKNAWN4HUTOI4H4LJ5KBJAS/events.json","paper":"https://pith.science/paper/YABZKNAW"},"agent_actions":{"view_html":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS","download_json":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS.json","view_paper":"https://pith.science/paper/YABZKNAW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.09973&json=true","fetch_graph":"https://pith.science/api/pith-number/YABZKNAWN4HUTOI4H4LJ5KBJAS/graph.json","fetch_events":"https://pith.science/api/pith-number/YABZKNAWN4HUTOI4H4LJ5KBJAS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS/action/storage_attestation","attest_author":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS/action/author_attestation","sign_citation":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS/action/citation_signature","submit_replication":"https://pith.science/pith/YABZKNAWN4HUTOI4H4LJ5KBJAS/action/replication_record"}},"created_at":"2026-07-05T11:36:43.081607+00:00","updated_at":"2026-07-05T11:36:43.081607+00:00"}