{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:2DIXEHSO4FOQRP2JSTIFUA6F4F","short_pith_number":"pith:2DIXEHSO","schema_version":"1.0","canonical_sha256":"d0d1721e4ee15d08bf4994d05a03c5e1515ddb1e7858459ea8b282ab3650d43d","source":{"kind":"arxiv","id":"2507.01496","version":1},"attestation_state":"computed","paper":{"title":"ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jimyeong Kim, Jungwon Park, Nojun Kwak, Wonjong Rhee, Yeji Song","submitted_at":"2025-07-02T08:58:18Z","abstract_excerpt":"Rectified Flow text-to-image models surpass diffusion models in image quality and text alignment, but adapting ReFlow for real-image editing remains challenging. We propose a new real-image editing method for ReFlow by analyzing the intermediate representations of multimodal transformer blocks and identifying three key features. To extract these features from real images with sufficient structural preservation, we leverage mid-step latent, which is inverted only up to the mid-step. We then adapt attention during injection to improve editability and enhance alignment to the target text. Our met"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.01496","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-07-02T08:58:18Z","cross_cats_sorted":[],"title_canon_sha256":"79a16ac0fa97c4f794c12a045fb458720610feec594d75b3527a58feb73ba3c8","abstract_canon_sha256":"2ecc2746a3ad4034a30a05eb116537d99f21b2a4c2049ee8971dfc27bf5610a7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:30:49.929542Z","signature_b64":"1AAwXc+K9WETw19ixQTCdqjNONYuogTaUBYweGnXtTIYZGye31gLXo20ZTwjh8sddH19/lNJ/vRVYwLRmMsLAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d0d1721e4ee15d08bf4994d05a03c5e1515ddb1e7858459ea8b282ab3650d43d","last_reissued_at":"2026-07-05T11:30:49.929071Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:30:49.929071Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jimyeong Kim, Jungwon Park, Nojun Kwak, Wonjong Rhee, Yeji Song","submitted_at":"2025-07-02T08:58:18Z","abstract_excerpt":"Rectified Flow text-to-image models surpass diffusion models in image quality and text alignment, but adapting ReFlow for real-image editing remains challenging. We propose a new real-image editing method for ReFlow by analyzing the intermediate representations of multimodal transformer blocks and identifying three key features. To extract these features from real images with sufficient structural preservation, we leverage mid-step latent, which is inverted only up to the mid-step. We then adapt attention during injection to improve editability and enhance alignment to the target text. Our met"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.01496","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.01496/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.01496","created_at":"2026-07-05T11:30:49.929128+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.01496v1","created_at":"2026-07-05T11:30:49.929128+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.01496","created_at":"2026-07-05T11:30:49.929128+00:00"},{"alias_kind":"pith_short_12","alias_value":"2DIXEHSO4FOQ","created_at":"2026-07-05T11:30:49.929128+00:00"},{"alias_kind":"pith_short_16","alias_value":"2DIXEHSO4FOQRP2J","created_at":"2026-07-05T11:30:49.929128+00:00"},{"alias_kind":"pith_short_8","alias_value":"2DIXEHSO","created_at":"2026-07-05T11:30:49.929128+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.06813","citing_title":"Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29390","citing_title":"Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14270","citing_title":"Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F","json":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F.json","graph_json":"https://pith.science/api/pith-number/2DIXEHSO4FOQRP2JSTIFUA6F4F/graph.json","events_json":"https://pith.science/api/pith-number/2DIXEHSO4FOQRP2JSTIFUA6F4F/events.json","paper":"https://pith.science/paper/2DIXEHSO"},"agent_actions":{"view_html":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F","download_json":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F.json","view_paper":"https://pith.science/paper/2DIXEHSO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.01496&json=true","fetch_graph":"https://pith.science/api/pith-number/2DIXEHSO4FOQRP2JSTIFUA6F4F/graph.json","fetch_events":"https://pith.science/api/pith-number/2DIXEHSO4FOQRP2JSTIFUA6F4F/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F/action/storage_attestation","attest_author":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F/action/author_attestation","sign_citation":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F/action/citation_signature","submit_replication":"https://pith.science/pith/2DIXEHSO4FOQRP2JSTIFUA6F4F/action/replication_record"}},"created_at":"2026-07-05T11:30:49.929128+00:00","updated_at":"2026-07-05T11:30:49.929128+00:00"}