{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:HZRHEAAER5ZCYWETU2PH3W6P54","short_pith_number":"pith:HZRHEAAE","schema_version":"1.0","canonical_sha256":"3e627200048f722c5893a69e7ddbcfef0e0e8156f11a3d1809c197938ffafbe5","source":{"kind":"arxiv","id":"2505.19149","version":1},"attestation_state":"computed","paper":{"title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jian Zhang, Qian Wang, Shijie Zhao, Shuyu Wang, Weiqi Li","submitted_at":"2025-05-25T13:54:31Z","abstract_excerpt":"Recent advances in AI-generated content (AIGC) have significantly accelerated image editing techniques, driving increasing demand for diverse and fine-grained edits. Despite these advances, existing image editing methods still face challenges in achieving high precision and semantic accuracy in complex scenarios. Recent studies address this issue by incorporating multimodal large language models (MLLMs) into image editing pipelines. However, current MLLM-based methods mainly rely on interpreting textual instructions, leaving the intrinsic visual understanding of large models largely unexplored"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.19149","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-05-25T13:54:31Z","cross_cats_sorted":[],"title_canon_sha256":"c7a0015e8484bb30fc54fb5de4e3f8dbaf6cd95971e3263b21f762cb28c44cd6","abstract_canon_sha256":"90667b2c3b128ae586e2bd3d2e5024e411b0dfdb462bc548dd8a9d21c39233fa"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:09:25.632543Z","signature_b64":"8m729Wb0DXaApNtfFE8AkHZmWBvS9Zo7205rRK4mOGUQozZ1IWPJzXpuQ6mUe1qh6bCWcXCoHw/vD0I490oaDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3e627200048f722c5893a69e7ddbcfef0e0e8156f11a3d1809c197938ffafbe5","last_reissued_at":"2026-07-05T11:09:25.631902Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:09:25.631902Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jian Zhang, Qian Wang, Shijie Zhao, Shuyu Wang, Weiqi Li","submitted_at":"2025-05-25T13:54:31Z","abstract_excerpt":"Recent advances in AI-generated content (AIGC) have significantly accelerated image editing techniques, driving increasing demand for diverse and fine-grained edits. Despite these advances, existing image editing methods still face challenges in achieving high precision and semantic accuracy in complex scenarios. Recent studies address this issue by incorporating multimodal large language models (MLLMs) into image editing pipelines. However, current MLLM-based methods mainly rely on interpreting textual instructions, leaving the intrinsic visual understanding of large models largely unexplored"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.19149","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.19149/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.19149","created_at":"2026-07-05T11:09:25.631990+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.19149v1","created_at":"2026-07-05T11:09:25.631990+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.19149","created_at":"2026-07-05T11:09:25.631990+00:00"},{"alias_kind":"pith_short_12","alias_value":"HZRHEAAER5ZC","created_at":"2026-07-05T11:09:25.631990+00:00"},{"alias_kind":"pith_short_16","alias_value":"HZRHEAAER5ZCYWET","created_at":"2026-07-05T11:09:25.631990+00:00"},{"alias_kind":"pith_short_8","alias_value":"HZRHEAAE","created_at":"2026-07-05T11:09:25.631990+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.05730","citing_title":"TextWand: A Unified Framework for Scene Text Editing","ref_index":34,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54","json":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54.json","graph_json":"https://pith.science/api/pith-number/HZRHEAAER5ZCYWETU2PH3W6P54/graph.json","events_json":"https://pith.science/api/pith-number/HZRHEAAER5ZCYWETU2PH3W6P54/events.json","paper":"https://pith.science/paper/HZRHEAAE"},"agent_actions":{"view_html":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54","download_json":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54.json","view_paper":"https://pith.science/paper/HZRHEAAE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.19149&json=true","fetch_graph":"https://pith.science/api/pith-number/HZRHEAAER5ZCYWETU2PH3W6P54/graph.json","fetch_events":"https://pith.science/api/pith-number/HZRHEAAER5ZCYWETU2PH3W6P54/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54/action/storage_attestation","attest_author":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54/action/author_attestation","sign_citation":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54/action/citation_signature","submit_replication":"https://pith.science/pith/HZRHEAAER5ZCYWETU2PH3W6P54/action/replication_record"}},"created_at":"2026-07-05T11:09:25.631990+00:00","updated_at":"2026-07-05T11:09:25.631990+00:00"}