{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:C6O7ZAKAZ73UFTCHDFA47J2MK4","short_pith_number":"pith:C6O7ZAKA","schema_version":"1.0","canonical_sha256":"179dfc8140cff742cc471941cfa74c5738e44149d7749fc555152599103cf144","source":{"kind":"arxiv","id":"2404.02733","version":2},"attestation_state":"computed","paper":{"title":"InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Anthony Chen, Haofan Wang, Matteo Spinelli, Qixun Wang, Xu Bai, Zekui Qin","submitted_at":"2024-04-03T13:34:09Z","abstract_excerpt":"Tuning-free diffusion-based models have demonstrated significant potential in the realm of image personalization and customization. However, despite this notable progress, current models continue to grapple with several complex challenges in producing style-consistent image generation. Firstly, the concept of style is inherently underdetermined, encompassing a multitude of elements such as color, material, atmosphere, design, and structure, among others. Secondly, inversion-based methods are prone to style degradation, often resulting in the loss of fine-grained details. Lastly, adapter-based "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.02733","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-04-03T13:34:09Z","cross_cats_sorted":[],"title_canon_sha256":"6bed7bc0cd4b2720a2650222a0c083726eb5c30f7df940b59979bfaf2148d521","abstract_canon_sha256":"c4c815ff514f6828385af7f6c4f1e88088bd2f22b199a78d50988d2bcff67b9d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:04:39.381616Z","signature_b64":"sZr3+mfA03F7RQW5DDhmW+Ap71aw1jv1SK97zV7weRF+R0GviCM24VnDBDVWhuic3lx3i12XXYEVi4C/WiV2Bg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"179dfc8140cff742cc471941cfa74c5738e44149d7749fc555152599103cf144","last_reissued_at":"2026-07-05T08:04:39.381148Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:04:39.381148Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Anthony Chen, Haofan Wang, Matteo Spinelli, Qixun Wang, Xu Bai, Zekui Qin","submitted_at":"2024-04-03T13:34:09Z","abstract_excerpt":"Tuning-free diffusion-based models have demonstrated significant potential in the realm of image personalization and customization. However, despite this notable progress, current models continue to grapple with several complex challenges in producing style-consistent image generation. Firstly, the concept of style is inherently underdetermined, encompassing a multitude of elements such as color, material, atmosphere, design, and structure, among others. Secondly, inversion-based methods are prone to style degradation, often resulting in the loss of fine-grained details. Lastly, adapter-based "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.02733","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.02733/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.02733","created_at":"2026-07-05T08:04:39.381206+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.02733v2","created_at":"2026-07-05T08:04:39.381206+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.02733","created_at":"2026-07-05T08:04:39.381206+00:00"},{"alias_kind":"pith_short_12","alias_value":"C6O7ZAKAZ73U","created_at":"2026-07-05T08:04:39.381206+00:00"},{"alias_kind":"pith_short_16","alias_value":"C6O7ZAKAZ73UFTCH","created_at":"2026-07-05T08:04:39.381206+00:00"},{"alias_kind":"pith_short_8","alias_value":"C6O7ZAKA","created_at":"2026-07-05T08:04:39.381206+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07119","citing_title":"ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching","ref_index":38,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25465","citing_title":"EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20506","citing_title":"FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28696","citing_title":"COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26538","citing_title":"Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2412.12242","citing_title":"OmniPrism: Learning Disentangled Visual Concept for Image Generation","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2503.19034","citing_title":"Color Conditional Generation with Sliced Wasserstein Guidance","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20237","citing_title":"AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17312","citing_title":"VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2603.08090","citing_title":"DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2603.20725","citing_title":"Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12038","citing_title":"OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00548","citing_title":"Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation","ref_index":119,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00548","citing_title":"Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation","ref_index":119,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08760","citing_title":"SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08364","citing_title":"MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07477","citing_title":"ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07210","citing_title":"VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14302","citing_title":"Geometrically Consistent Multi-View Scene Generation from Freehand Sketches","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02393","citing_title":"FEAT: Fashion Editing and Try-On from Any Design","ref_index":25,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4","json":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4.json","graph_json":"https://pith.science/api/pith-number/C6O7ZAKAZ73UFTCHDFA47J2MK4/graph.json","events_json":"https://pith.science/api/pith-number/C6O7ZAKAZ73UFTCHDFA47J2MK4/events.json","paper":"https://pith.science/paper/C6O7ZAKA"},"agent_actions":{"view_html":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4","download_json":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4.json","view_paper":"https://pith.science/paper/C6O7ZAKA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.02733&json=true","fetch_graph":"https://pith.science/api/pith-number/C6O7ZAKAZ73UFTCHDFA47J2MK4/graph.json","fetch_events":"https://pith.science/api/pith-number/C6O7ZAKAZ73UFTCHDFA47J2MK4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4/action/storage_attestation","attest_author":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4/action/author_attestation","sign_citation":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4/action/citation_signature","submit_replication":"https://pith.science/pith/C6O7ZAKAZ73UFTCHDFA47J2MK4/action/replication_record"}},"created_at":"2026-07-05T08:04:39.381206+00:00","updated_at":"2026-07-05T08:04:39.381206+00:00"}