{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NMZKXXJA4ETFKMLXZVISLAINPV","short_pith_number":"pith:NMZKXXJA","schema_version":"1.0","canonical_sha256":"6b32abdd20e126553177cd5125810d7d5275842f2bfa32a47bf22a66b865c3ef","source":{"kind":"arxiv","id":"2506.00103","version":2},"attestation_state":"computed","paper":{"title":"Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Guanjun Jiang, Jianhe Lin, Kai Luo, Ruipeng Jia, Shihao Huang, Xiaoxi Jiang, Yongbo Gai, Yunyi Yang","submitted_at":"2025-05-30T14:34:57Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) has enabled large language models (LLMs) to achieve remarkable breakthroughs in reasoning tasks with objective ground-truth answers, such as mathematics and code generation. However, a significant gap remains for non-verifiable tasks, like creative writing and open-ended dialogue, where quality assessment is inherently subjective and lacks definitive references. Existing approaches for these domains often rely on scalar reward models trained with human preferences, which suffer from limited generalization and are prone to reward hacking, su"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.00103","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-05-30T14:34:57Z","cross_cats_sorted":[],"title_canon_sha256":"ed9f30c73101513a732496c72701503e49f83c0d34b0371a543bb8dfe0b1deae","abstract_canon_sha256":"540512b6eaa919153c6df55380bd28d5e916310ffff8c2fd77489c7040dc5a9c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:19:53.168536Z","signature_b64":"D4b6Aa22Nln5Tot4SZymGq6+0YgFG1CC6dP7H/K0VYFPT2ZLqae2DafVw0zOiIrp7YlwiaCaXD0Vv2GtYhzGBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6b32abdd20e126553177cd5125810d7d5275842f2bfa32a47bf22a66b865c3ef","last_reissued_at":"2026-07-05T11:19:53.168112Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:19:53.168112Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Guanjun Jiang, Jianhe Lin, Kai Luo, Ruipeng Jia, Shihao Huang, Xiaoxi Jiang, Yongbo Gai, Yunyi Yang","submitted_at":"2025-05-30T14:34:57Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) has enabled large language models (LLMs) to achieve remarkable breakthroughs in reasoning tasks with objective ground-truth answers, such as mathematics and code generation. However, a significant gap remains for non-verifiable tasks, like creative writing and open-ended dialogue, where quality assessment is inherently subjective and lacks definitive references. Existing approaches for these domains often rely on scalar reward models trained with human preferences, which suffer from limited generalization and are prone to reward hacking, su"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.00103","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.00103/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.00103","created_at":"2026-07-05T11:19:53.168167+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.00103v2","created_at":"2026-07-05T11:19:53.168167+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.00103","created_at":"2026-07-05T11:19:53.168167+00:00"},{"alias_kind":"pith_short_12","alias_value":"NMZKXXJA4ETF","created_at":"2026-07-05T11:19:53.168167+00:00"},{"alias_kind":"pith_short_16","alias_value":"NMZKXXJA4ETFKMLX","created_at":"2026-07-05T11:19:53.168167+00:00"},{"alias_kind":"pith_short_8","alias_value":"NMZKXXJA","created_at":"2026-07-05T11:19:53.168167+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08326","citing_title":"Diagnosing and Repairing Persona Collapse in LLM Advice","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25757","citing_title":"OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09393","citing_title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04923","citing_title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30803","citing_title":"PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21491","citing_title":"Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21464","citing_title":"Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27453","citing_title":"From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04831","citing_title":"StoryAlign: Evaluating and Training Reward Models for Story Generation","ref_index":14,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV","json":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV.json","graph_json":"https://pith.science/api/pith-number/NMZKXXJA4ETFKMLXZVISLAINPV/graph.json","events_json":"https://pith.science/api/pith-number/NMZKXXJA4ETFKMLXZVISLAINPV/events.json","paper":"https://pith.science/paper/NMZKXXJA"},"agent_actions":{"view_html":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV","download_json":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV.json","view_paper":"https://pith.science/paper/NMZKXXJA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.00103&json=true","fetch_graph":"https://pith.science/api/pith-number/NMZKXXJA4ETFKMLXZVISLAINPV/graph.json","fetch_events":"https://pith.science/api/pith-number/NMZKXXJA4ETFKMLXZVISLAINPV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV/action/storage_attestation","attest_author":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV/action/author_attestation","sign_citation":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV/action/citation_signature","submit_replication":"https://pith.science/pith/NMZKXXJA4ETFKMLXZVISLAINPV/action/replication_record"}},"created_at":"2026-07-05T11:19:53.168167+00:00","updated_at":"2026-07-05T11:19:53.168167+00:00"}