{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:S3VB5VUH6GFTVU7MWXFEDX37NJ","short_pith_number":"pith:S3VB5VUH","schema_version":"1.0","canonical_sha256":"96ea1ed687f18b3ad3ecb5ca41df7f6a4c36c12c478007902b9498064b8a57e3","source":{"kind":"arxiv","id":"2212.05032","version":3},"attestation_state":"computed","paper":{"title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Arjun Akula, Pradyumna Narayana, Sugato Basu, Tsu-Jui Fu, Varun Jampani, Weixi Feng, William Yang Wang, Xin Eric Wang, Xuehai He","submitted_at":"2022-12-09T18:30:24Z","abstract_excerpt":"Large-scale diffusion models have achieved state-of-the-art results on text-to-image synthesis (T2I) tasks. Despite their ability to generate high-quality yet creative images, we observe that attribution-binding and compositional capabilities are still considered major challenging issues, especially when involving multiple objects. In this work, we improve the compositional skills of T2I models, specifically more accurate attribute binding and better image compositions. To do this, we incorporate linguistic structures with the diffusion guidance process based on the controllable properties of "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2212.05032","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2022-12-09T18:30:24Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"b3d15fb086fae54bf4b6a3e8702f5da65b0f934c6065784dd798475ab96cc112","abstract_canon_sha256":"e342fe7aa5e5f44d404c4d9540235b07daeb3cbb268ea560d15b18f108afc0fb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:46:52.949129Z","signature_b64":"WKOaFirvtQum0gPz8iHTVLQ36XvA3oNoiZkU0w6IIHE/e4wGlP+5m0iuMzh2cv0miSkGeFoblWsTiA451dCtCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"96ea1ed687f18b3ad3ecb5ca41df7f6a4c36c12c478007902b9498064b8a57e3","last_reissued_at":"2026-07-05T05:46:52.948705Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:46:52.948705Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Arjun Akula, Pradyumna Narayana, Sugato Basu, Tsu-Jui Fu, Varun Jampani, Weixi Feng, William Yang Wang, Xin Eric Wang, Xuehai He","submitted_at":"2022-12-09T18:30:24Z","abstract_excerpt":"Large-scale diffusion models have achieved state-of-the-art results on text-to-image synthesis (T2I) tasks. Despite their ability to generate high-quality yet creative images, we observe that attribution-binding and compositional capabilities are still considered major challenging issues, especially when involving multiple objects. In this work, we improve the compositional skills of T2I models, specifically more accurate attribute binding and better image compositions. To do this, we incorporate linguistic structures with the diffusion guidance process based on the controllable properties of "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2212.05032","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2212.05032/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2212.05032","created_at":"2026-07-05T05:46:52.948761+00:00"},{"alias_kind":"arxiv_version","alias_value":"2212.05032v3","created_at":"2026-07-05T05:46:52.948761+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2212.05032","created_at":"2026-07-05T05:46:52.948761+00:00"},{"alias_kind":"pith_short_12","alias_value":"S3VB5VUH6GFT","created_at":"2026-07-05T05:46:52.948761+00:00"},{"alias_kind":"pith_short_16","alias_value":"S3VB5VUH6GFTVU7M","created_at":"2026-07-05T05:46:52.948761+00:00"},{"alias_kind":"pith_short_8","alias_value":"S3VB5VUH","created_at":"2026-07-05T05:46:52.948761+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27377","citing_title":"DanceOPD: On-Policy Generative Field Distillation","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10653","citing_title":"STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09313","citing_title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21466","citing_title":"StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14988","citing_title":"Compositional Video Generation via Inference-Time Guidance","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07568","citing_title":"A Systematic Study of Behavioral Cloning for Scientific Data Annotation","ref_index":248,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23178","citing_title":"Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21466","citing_title":"StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19750","citing_title":"CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2505.19261","citing_title":"Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2509.17458","citing_title":"CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2510.20206","citing_title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2302.08453","citing_title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2302.12192","citing_title":"Aligning Text-to-Image Models using Human Feedback","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09313","citing_title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09313","citing_title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2403.05135","citing_title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06512","citing_title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07253","citing_title":"LENS: Low-Frequency Eigen Noise Shaping for Efficient Diffusion Sampling","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05906","citing_title":"Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2307.01952","citing_title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","ref_index":8,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ","json":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ.json","graph_json":"https://pith.science/api/pith-number/S3VB5VUH6GFTVU7MWXFEDX37NJ/graph.json","events_json":"https://pith.science/api/pith-number/S3VB5VUH6GFTVU7MWXFEDX37NJ/events.json","paper":"https://pith.science/paper/S3VB5VUH"},"agent_actions":{"view_html":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ","download_json":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ.json","view_paper":"https://pith.science/paper/S3VB5VUH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2212.05032&json=true","fetch_graph":"https://pith.science/api/pith-number/S3VB5VUH6GFTVU7MWXFEDX37NJ/graph.json","fetch_events":"https://pith.science/api/pith-number/S3VB5VUH6GFTVU7MWXFEDX37NJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ/action/storage_attestation","attest_author":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ/action/author_attestation","sign_citation":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ/action/citation_signature","submit_replication":"https://pith.science/pith/S3VB5VUH6GFTVU7MWXFEDX37NJ/action/replication_record"}},"created_at":"2026-07-05T05:46:52.948761+00:00","updated_at":"2026-07-05T05:46:52.948761+00:00"}