{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:DCWWDQBVITJIZY43EADYBGEMIX","short_pith_number":"pith:DCWWDQBV","schema_version":"1.0","canonical_sha256":"18ad61c03544d28ce39b200780988c45d910353bd75ab1744f22b768af813cd3","source":{"kind":"arxiv","id":"2206.11871","version":2},"attestation_state":"computed","paper":{"title":"Offline RL for Natural Language Generation with Implicit Language Q Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Charlie Snell, Ilya Kostrikov, Mengjiao Yang, Sergey Levine, Yi Su","submitted_at":"2022-06-05T18:38:42Z","abstract_excerpt":"Large language models distill broad knowledge from text corpora. However, they can be inconsistent when it comes to completing user specified tasks. This issue can be addressed by finetuning such models via supervised learning on curated datasets, or via reinforcement learning. In this work, we propose a novel offline RL method, implicit language Q-learning (ILQL), designed for use on language models, that combines both the flexible utility maximization framework of RL algorithms with the ability of supervised learning to leverage previously collected data, as well as its simplicity and stabil"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2206.11871","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2022-06-05T18:38:42Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"7bd07572af659ab055a87f1cc262e699f73bcbd46a3eb3027f53bce40d10ee33","abstract_canon_sha256":"6e6eb7c5cdc5d339c2338e86f390df664523e017d4bdc4c813b514ec43b561ff"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:05:27.571571Z","signature_b64":"NLTLNQdWyF6LFQ4ji2qoyDgRqh8GTVbw58Py4zpU7tE+FqdYxHM5X/HzskYc7Pf0R9x4QUZmPxW1xERXT50DBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"18ad61c03544d28ce39b200780988c45d910353bd75ab1744f22b768af813cd3","last_reissued_at":"2026-07-05T06:05:27.571080Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:05:27.571080Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Offline RL for Natural Language Generation with Implicit Language Q Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Charlie Snell, Ilya Kostrikov, Mengjiao Yang, Sergey Levine, Yi Su","submitted_at":"2022-06-05T18:38:42Z","abstract_excerpt":"Large language models distill broad knowledge from text corpora. However, they can be inconsistent when it comes to completing user specified tasks. This issue can be addressed by finetuning such models via supervised learning on curated datasets, or via reinforcement learning. In this work, we propose a novel offline RL method, implicit language Q-learning (ILQL), designed for use on language models, that combines both the flexible utility maximization framework of RL algorithms with the ability of supervised learning to leverage previously collected data, as well as its simplicity and stabil"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2206.11871","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2206.11871/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2206.11871","created_at":"2026-07-05T06:05:27.571136+00:00"},{"alias_kind":"arxiv_version","alias_value":"2206.11871v2","created_at":"2026-07-05T06:05:27.571136+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2206.11871","created_at":"2026-07-05T06:05:27.571136+00:00"},{"alias_kind":"pith_short_12","alias_value":"DCWWDQBVITJI","created_at":"2026-07-05T06:05:27.571136+00:00"},{"alias_kind":"pith_short_16","alias_value":"DCWWDQBVITJIZY43","created_at":"2026-07-05T06:05:27.571136+00:00"},{"alias_kind":"pith_short_8","alias_value":"DCWWDQBV","created_at":"2026-07-05T06:05:27.571136+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21943","citing_title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","ref_index":181,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01557","citing_title":"DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28409","citing_title":"Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2505.19075","citing_title":"Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2409.12917","citing_title":"Training Language Models to Self-Correct via Reinforcement Learning","ref_index":176,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14004","citing_title":"Conditional Attribute Estimation with Autoregressive Sequence Models","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06987","citing_title":"Response Time Enhances Alignment with Heterogeneous Preferences","ref_index":49,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX","json":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX.json","graph_json":"https://pith.science/api/pith-number/DCWWDQBVITJIZY43EADYBGEMIX/graph.json","events_json":"https://pith.science/api/pith-number/DCWWDQBVITJIZY43EADYBGEMIX/events.json","paper":"https://pith.science/paper/DCWWDQBV"},"agent_actions":{"view_html":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX","download_json":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX.json","view_paper":"https://pith.science/paper/DCWWDQBV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2206.11871&json=true","fetch_graph":"https://pith.science/api/pith-number/DCWWDQBVITJIZY43EADYBGEMIX/graph.json","fetch_events":"https://pith.science/api/pith-number/DCWWDQBVITJIZY43EADYBGEMIX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX/action/storage_attestation","attest_author":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX/action/author_attestation","sign_citation":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX/action/citation_signature","submit_replication":"https://pith.science/pith/DCWWDQBVITJIZY43EADYBGEMIX/action/replication_record"}},"created_at":"2026-07-05T06:05:27.571136+00:00","updated_at":"2026-07-05T06:05:27.571136+00:00"}