{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:KYVGZYBUM35W52A7ZYFZC6VEIE","short_pith_number":"pith:KYVGZYBU","schema_version":"1.0","canonical_sha256":"562a6ce03466fb6ee81fce0b917aa44126126e6a3276a731b1d1913a95307ac6","source":{"kind":"arxiv","id":"2502.02538","version":2},"attestation_state":"computed","paper":{"title":"Flow Q-Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Qiyang Li, Seohong Park, Sergey Levine","submitted_at":"2025-02-04T18:04:05Z","abstract_excerpt":"We present flow Q-learning (FQL), a simple and performant offline reinforcement learning (RL) method that leverages an expressive flow-matching policy to model arbitrarily complex action distributions in data. Training a flow policy with RL is a tricky problem, due to the iterative nature of the action generation process. We address this challenge by training an expressive one-step policy with RL, rather than directly guiding an iterative flow policy to maximize values. This way, we can completely avoid unstable recursive backpropagation, eliminate costly iterative action generation at test ti"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.02538","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-02-04T18:04:05Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"0b13dc44f9e0fc2e63d798c1f82e62c7e4f22e387d9656af49616440a42a532c","abstract_canon_sha256":"f281399a3f7a9159d043f265c8a2a56031834514468733784aa4cdf98cb60aca"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:09:07.576446Z","signature_b64":"rKplNfaOiia5OFIABXOz1vJn+H89YAW3drrmCo3aZpVpQhz5E9jeA4VfNbZen+2Cf/odCpdU1k3gyFVXwttNAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"562a6ce03466fb6ee81fce0b917aa44126126e6a3276a731b1d1913a95307ac6","last_reissued_at":"2026-07-05T11:09:07.575960Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:09:07.575960Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Flow Q-Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Qiyang Li, Seohong Park, Sergey Levine","submitted_at":"2025-02-04T18:04:05Z","abstract_excerpt":"We present flow Q-learning (FQL), a simple and performant offline reinforcement learning (RL) method that leverages an expressive flow-matching policy to model arbitrarily complex action distributions in data. Training a flow policy with RL is a tricky problem, due to the iterative nature of the action generation process. We address this challenge by training an expressive one-step policy with RL, rather than directly guiding an iterative flow policy to maximize values. This way, we can completely avoid unstable recursive backpropagation, eliminate costly iterative action generation at test ti"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.02538","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.02538/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.02538","created_at":"2026-07-05T11:09:07.576020+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.02538v2","created_at":"2026-07-05T11:09:07.576020+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.02538","created_at":"2026-07-05T11:09:07.576020+00:00"},{"alias_kind":"pith_short_12","alias_value":"KYVGZYBUM35W","created_at":"2026-07-05T11:09:07.576020+00:00"},{"alias_kind":"pith_short_16","alias_value":"KYVGZYBUM35W52A7","created_at":"2026-07-05T11:09:07.576020+00:00"},{"alias_kind":"pith_short_8","alias_value":"KYVGZYBU","created_at":"2026-07-05T11:09:07.576020+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07855","citing_title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","ref_index":35,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21086","citing_title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10613","citing_title":"Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11087","citing_title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06967","citing_title":"GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03201","citing_title":"Reinforcement Learning from Cross-domain Videos with Video Prediction Model","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30056","citing_title":"Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01151","citing_title":"Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2506.08902","citing_title":"Intention-Conditioned Flow Occupancy Models","ref_index":85,"is_internal_anchor":false},{"citing_arxiv_id":"2507.07969","citing_title":"Reinforcement Learning with Action Chunking","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2507.07986","citing_title":"EXPO: Stable Reinforcement Learning with Expressive Policies","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2506.15799","citing_title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2602.02924","citing_title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2603.04333","citing_title":"What Does Flow Matching Bring To TD Learning?","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05812","citing_title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08253","citing_title":"Path-Coupled Bellman Flows for Distributional Reinforcement Learning","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05812","citing_title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22229","citing_title":"Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05544","citing_title":"Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01356","citing_title":"Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10962","citing_title":"ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01663","citing_title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09159","citing_title":"Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08960","citing_title":"Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14265","citing_title":"Reinforcement Learning via Value Gradient Flow","ref_index":52,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE","json":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE.json","graph_json":"https://pith.science/api/pith-number/KYVGZYBUM35W52A7ZYFZC6VEIE/graph.json","events_json":"https://pith.science/api/pith-number/KYVGZYBUM35W52A7ZYFZC6VEIE/events.json","paper":"https://pith.science/paper/KYVGZYBU"},"agent_actions":{"view_html":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE","download_json":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE.json","view_paper":"https://pith.science/paper/KYVGZYBU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.02538&json=true","fetch_graph":"https://pith.science/api/pith-number/KYVGZYBUM35W52A7ZYFZC6VEIE/graph.json","fetch_events":"https://pith.science/api/pith-number/KYVGZYBUM35W52A7ZYFZC6VEIE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE/action/storage_attestation","attest_author":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE/action/author_attestation","sign_citation":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE/action/citation_signature","submit_replication":"https://pith.science/pith/KYVGZYBUM35W52A7ZYFZC6VEIE/action/replication_record"}},"created_at":"2026-07-05T11:09:07.576020+00:00","updated_at":"2026-07-05T11:09:07.576020+00:00"}