{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:RVR5UJJOFYMBJJDVDRXZTOIVMJ","short_pith_number":"pith:RVR5UJJO","schema_version":"1.0","canonical_sha256":"8d63da252e2e1814a4751c6f99b915625577df3b33537f39d880d1a18ec3c60a","source":{"kind":"arxiv","id":"2205.12548","version":3},"attestation_state":"computed","paper":{"title":"RLPrompt: Optimizing Discrete Text Prompts with Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Cheng-Ping Hsieh, Eric P. Xing, Han Guo, Jianyu Wang, Meng Song, Mingkai Deng, Tianmin Shu, Yihan Wang, Zhiting Hu","submitted_at":"2022-05-25T07:50:31Z","abstract_excerpt":"Prompting has shown impressive success in enabling large pretrained language models (LMs) to perform diverse NLP tasks, especially when only few downstream data are available. Automatically finding the optimal prompt for each task, however, is challenging. Most existing work resorts to tuning soft prompt (e.g., embeddings) which falls short of interpretability, reusability across LMs, and applicability when gradients are not accessible. Discrete prompt, on the other hand, is difficult to optimize, and is often created by \"enumeration (e.g., paraphrasing)-then-selection\" heuristics that do not "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2205.12548","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2022-05-25T07:50:31Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"dde85f4f2fcc32ecca3be3a9ffb354d7ea8e573c7187583343772c59e6e2c4d4","abstract_canon_sha256":"f385fa311f9b47ce91d427fbf91833af836d1312b295ebfa8cfeb85a375f0d78"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:09:18.635949Z","signature_b64":"hja9DaJVcvkC3ZQU+BbnWQrPgT0pYPkLOkbjV8TOfuzzz9wpxi7ajPM3myoM6u6M6USwpzDLdrE223JYhwoCAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8d63da252e2e1814a4751c6f99b915625577df3b33537f39d880d1a18ec3c60a","last_reissued_at":"2026-07-05T05:09:18.635541Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:09:18.635541Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RLPrompt: Optimizing Discrete Text Prompts with Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Cheng-Ping Hsieh, Eric P. Xing, Han Guo, Jianyu Wang, Meng Song, Mingkai Deng, Tianmin Shu, Yihan Wang, Zhiting Hu","submitted_at":"2022-05-25T07:50:31Z","abstract_excerpt":"Prompting has shown impressive success in enabling large pretrained language models (LMs) to perform diverse NLP tasks, especially when only few downstream data are available. Automatically finding the optimal prompt for each task, however, is challenging. Most existing work resorts to tuning soft prompt (e.g., embeddings) which falls short of interpretability, reusability across LMs, and applicability when gradients are not accessible. Discrete prompt, on the other hand, is difficult to optimize, and is often created by \"enumeration (e.g., paraphrasing)-then-selection\" heuristics that do not "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2205.12548","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2205.12548/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2205.12548","created_at":"2026-07-05T05:09:18.635606+00:00"},{"alias_kind":"arxiv_version","alias_value":"2205.12548v3","created_at":"2026-07-05T05:09:18.635606+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2205.12548","created_at":"2026-07-05T05:09:18.635606+00:00"},{"alias_kind":"pith_short_12","alias_value":"RVR5UJJOFYMB","created_at":"2026-07-05T05:09:18.635606+00:00"},{"alias_kind":"pith_short_16","alias_value":"RVR5UJJOFYMBJJDV","created_at":"2026-07-05T05:09:18.635606+00:00"},{"alias_kind":"pith_short_8","alias_value":"RVR5UJJO","created_at":"2026-07-05T05:09:18.635606+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11853","citing_title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","ref_index":103,"is_internal_anchor":false},{"citing_arxiv_id":"2407.17491","citing_title":"Robust Adaptation of Foundation Models with Black-Box Visual Prompting","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19102","citing_title":"Prompt Optimization for LLM Code Generation via Reinforcement Learning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2512.11013","citing_title":"PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2603.10477","citing_title":"PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12484","citing_title":"Learning, Fast and Slow: Towards LLMs That Adapt Continually","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2309.03409","citing_title":"Large Language Models as Optimizers","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12484","citing_title":"Learning, Fast and Slow: Towards LLMs That Adapt Continually","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ","json":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ.json","graph_json":"https://pith.science/api/pith-number/RVR5UJJOFYMBJJDVDRXZTOIVMJ/graph.json","events_json":"https://pith.science/api/pith-number/RVR5UJJOFYMBJJDVDRXZTOIVMJ/events.json","paper":"https://pith.science/paper/RVR5UJJO"},"agent_actions":{"view_html":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ","download_json":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ.json","view_paper":"https://pith.science/paper/RVR5UJJO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2205.12548&json=true","fetch_graph":"https://pith.science/api/pith-number/RVR5UJJOFYMBJJDVDRXZTOIVMJ/graph.json","fetch_events":"https://pith.science/api/pith-number/RVR5UJJOFYMBJJDVDRXZTOIVMJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ/action/storage_attestation","attest_author":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ/action/author_attestation","sign_citation":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ/action/citation_signature","submit_replication":"https://pith.science/pith/RVR5UJJOFYMBJJDVDRXZTOIVMJ/action/replication_record"}},"created_at":"2026-07-05T05:09:18.635606+00:00","updated_at":"2026-07-05T05:09:18.635606+00:00"}