{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:RFWNDDP3RDJR2EY2T64B7LCKIR","short_pith_number":"pith:RFWNDDP3","schema_version":"1.0","canonical_sha256":"896cd18dfb88d31d131a9fb81fac4a4479b1565c6c48fe9a4cfa81af3ef14d87","source":{"kind":"arxiv","id":"2602.12155","version":2},"attestation_state":"computed","paper":{"title":"FAIL: Flow Matching Adversarial Imitation Learning for Image Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chen Li, Han Hu, Weidi Xie, Xiaosong Zhang, Yeyao Ma","submitted_at":"2026-02-12T16:36:33Z","abstract_excerpt":"Post-training of flow matching models-aligning the output distribution with a high-quality target-is mathematically equivalent to imitation learning. While Supervised Fine-Tuning mimics expert demonstrations effectively, it cannot correct policy drift in unseen states. Preference optimization methods address this but require costly preference pairs or reward modeling. We propose Flow Matching Adversarial Imitation Learning (FAIL), which minimizes policy-expert divergence through adversarial training without explicit rewards or pairwise comparisons. We derive two algorithms: FAIL-PD exploits di"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2602.12155","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2026-02-12T16:36:33Z","cross_cats_sorted":[],"title_canon_sha256":"5743e68832079745d5c472a283c6ef9e3e451aec49e6c976507820d86af7537a","abstract_canon_sha256":"379b9bd69317cd88095fbd9a6717cbdcfa4af69a79294b1aa74ad8daf027affe"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-06-30T02:17:15.760882Z","signature_b64":"vm6oCQLymIZXAtfVgsScB9f49H4+GULrgwIcgVYOmz8yM1sAkIGVPNSdk41D17iBnCAEUPgmRK+vMIFzz0woCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"896cd18dfb88d31d131a9fb81fac4a4479b1565c6c48fe9a4cfa81af3ef14d87","last_reissued_at":"2026-06-30T02:17:15.760112Z","signature_status":"signed_v1","first_computed_at":"2026-06-30T02:17:15.760112Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FAIL: Flow Matching Adversarial Imitation Learning for Image Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chen Li, Han Hu, Weidi Xie, Xiaosong Zhang, Yeyao Ma","submitted_at":"2026-02-12T16:36:33Z","abstract_excerpt":"Post-training of flow matching models-aligning the output distribution with a high-quality target-is mathematically equivalent to imitation learning. While Supervised Fine-Tuning mimics expert demonstrations effectively, it cannot correct policy drift in unseen states. Preference optimization methods address this but require costly preference pairs or reward modeling. We propose Flow Matching Adversarial Imitation Learning (FAIL), which minimizes policy-expert divergence through adversarial training without explicit rewards or pairwise comparisons. We derive two algorithms: FAIL-PD exploits di"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2602.12155","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2602.12155/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2602.12155","created_at":"2026-06-30T02:17:15.760191+00:00"},{"alias_kind":"arxiv_version","alias_value":"2602.12155v2","created_at":"2026-06-30T02:17:15.760191+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2602.12155","created_at":"2026-06-30T02:17:15.760191+00:00"},{"alias_kind":"pith_short_12","alias_value":"RFWNDDP3RDJR","created_at":"2026-06-30T02:17:15.760191+00:00"},{"alias_kind":"pith_short_16","alias_value":"RFWNDDP3RDJR2EY2","created_at":"2026-06-30T02:17:15.760191+00:00"},{"alias_kind":"pith_short_8","alias_value":"RFWNDDP3","created_at":"2026-06-30T02:17:15.760191+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2606.09711","citing_title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","ref_index":286,"is_internal_anchor":true},{"citing_arxiv_id":"2604.13602","citing_title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","ref_index":174,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR","json":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR.json","graph_json":"https://pith.science/api/pith-number/RFWNDDP3RDJR2EY2T64B7LCKIR/graph.json","events_json":"https://pith.science/api/pith-number/RFWNDDP3RDJR2EY2T64B7LCKIR/events.json","paper":"https://pith.science/paper/RFWNDDP3"},"agent_actions":{"view_html":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR","download_json":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR.json","view_paper":"https://pith.science/paper/RFWNDDP3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2602.12155&json=true","fetch_graph":"https://pith.science/api/pith-number/RFWNDDP3RDJR2EY2T64B7LCKIR/graph.json","fetch_events":"https://pith.science/api/pith-number/RFWNDDP3RDJR2EY2T64B7LCKIR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR/action/storage_attestation","attest_author":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR/action/author_attestation","sign_citation":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR/action/citation_signature","submit_replication":"https://pith.science/pith/RFWNDDP3RDJR2EY2T64B7LCKIR/action/replication_record"}},"created_at":"2026-06-30T02:17:15.760191+00:00","updated_at":"2026-06-30T02:17:15.760191+00:00"}