{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:FXGKPDUMOIZ43KZ3TSRJTQPPNP","short_pith_number":"pith:FXGKPDUM","schema_version":"1.0","canonical_sha256":"2dcca78e8c7233cdab3b9ca299c1ef6be4a973b171827b80b55078d5aa09d352","source":{"kind":"arxiv","id":"2412.18928","version":1},"attestation_state":"computed","paper":{"title":"UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Gui-Song Xia, Kaifu Zhang, Lunhao Duan, Mingming Gong, Qing-Guo Chen, Shanshan Zhao, Weihua Luo, Wenjun Yan, Yinglun Li, Zhao Xu","submitted_at":"2024-12-25T15:19:02Z","abstract_excerpt":"Recently, text-to-image generation models have achieved remarkable advancements, particularly with diffusion models facilitating high-quality image synthesis from textual descriptions. However, these models often struggle with achieving precise control over pixel-level layouts, object appearances, and global styles when using text prompts alone. To mitigate this issue, previous works introduce conditional images as auxiliary inputs for image generation, enhancing control but typically necessitating specialized models tailored to different types of reference inputs. In this paper, we explore a "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.18928","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-25T15:19:02Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"947cea0df90ae56109f9187335ec9d87fb70913f2854eaeb08ce78ff09b47443","abstract_canon_sha256":"6453d3c454e7b2ff6b02632091523f52e68b6c5d5d5c56f798f794bcc027e8e6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:54:13.318733Z","signature_b64":"e0FNmC94DHrimyjOjqI+XVYiw+UNYiNn/U/juc1TJW+6x1deRwP3G5Ny2JDroAkVuh8gcpfJeunaxNie0sUrAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2dcca78e8c7233cdab3b9ca299c1ef6be4a973b171827b80b55078d5aa09d352","last_reissued_at":"2026-07-05T09:54:13.318227Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:54:13.318227Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Gui-Song Xia, Kaifu Zhang, Lunhao Duan, Mingming Gong, Qing-Guo Chen, Shanshan Zhao, Weihua Luo, Wenjun Yan, Yinglun Li, Zhao Xu","submitted_at":"2024-12-25T15:19:02Z","abstract_excerpt":"Recently, text-to-image generation models have achieved remarkable advancements, particularly with diffusion models facilitating high-quality image synthesis from textual descriptions. However, these models often struggle with achieving precise control over pixel-level layouts, object appearances, and global styles when using text prompts alone. To mitigate this issue, previous works introduce conditional images as auxiliary inputs for image generation, enhancing control but typically necessitating specialized models tailored to different types of reference inputs. In this paper, we explore a "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.18928","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.18928/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.18928","created_at":"2026-07-05T09:54:13.318288+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.18928v1","created_at":"2026-07-05T09:54:13.318288+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.18928","created_at":"2026-07-05T09:54:13.318288+00:00"},{"alias_kind":"pith_short_12","alias_value":"FXGKPDUMOIZ4","created_at":"2026-07-05T09:54:13.318288+00:00"},{"alias_kind":"pith_short_16","alias_value":"FXGKPDUMOIZ43KZ3","created_at":"2026-07-05T09:54:13.318288+00:00"},{"alias_kind":"pith_short_8","alias_value":"FXGKPDUM","created_at":"2026-07-05T09:54:13.318288+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2503.07598","citing_title":"VACE: All-in-One Video Creation and Editing","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP","json":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP.json","graph_json":"https://pith.science/api/pith-number/FXGKPDUMOIZ43KZ3TSRJTQPPNP/graph.json","events_json":"https://pith.science/api/pith-number/FXGKPDUMOIZ43KZ3TSRJTQPPNP/events.json","paper":"https://pith.science/paper/FXGKPDUM"},"agent_actions":{"view_html":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP","download_json":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP.json","view_paper":"https://pith.science/paper/FXGKPDUM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.18928&json=true","fetch_graph":"https://pith.science/api/pith-number/FXGKPDUMOIZ43KZ3TSRJTQPPNP/graph.json","fetch_events":"https://pith.science/api/pith-number/FXGKPDUMOIZ43KZ3TSRJTQPPNP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP/action/storage_attestation","attest_author":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP/action/author_attestation","sign_citation":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP/action/citation_signature","submit_replication":"https://pith.science/pith/FXGKPDUMOIZ43KZ3TSRJTQPPNP/action/replication_record"}},"created_at":"2026-07-05T09:54:13.318288+00:00","updated_at":"2026-07-05T09:54:13.318288+00:00"}