{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GLCG56CREBTRQR2CGBLVISOPCN","short_pith_number":"pith:GLCG56CR","schema_version":"1.0","canonical_sha256":"32c46ef851206718474230575449cf1375cc0a8f438624a722672f6dd08a0793","source":{"kind":"arxiv","id":"2503.10618","version":2},"attestation_state":"computed","paper":{"title":"DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Alex Schwing, Bowen Zhang, Chen Chen, Jialing Tong, Lezhi Li, Rui Qian, Tsu-Jui Fu, Wei Liu, Wenze Hu, Xinze Wang, Yinfei Yang","submitted_at":"2025-03-13T17:57:25Z","abstract_excerpt":"In this work, we empirically study Diffusion Transformers (DiTs) for text-to-image generation, focusing on architectural choices, text-conditioning strategies, and training protocols. We evaluate a range of DiT-based architectures--including PixArt-style and MMDiT variants--and compare them with a standard DiT variant which directly processes concatenated text and noise inputs. Surprisingly, our findings reveal that the performance of standard DiT is comparable with those specialized models, while demonstrating superior parameter-efficiency, especially when scaled up. Leveraging the layer-wise"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.10618","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-03-13T17:57:25Z","cross_cats_sorted":[],"title_canon_sha256":"cefca661cf568cc8bae5c6e3f28c70668de440451a1f6d5ccc285e97bd125cb0","abstract_canon_sha256":"7756fbb4243e7b1fa293863c2f9b722e0563bc0351a78efeac4e84f5f78d39b2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:31:57.213243Z","signature_b64":"GJagsZOibf4AzMWyQRYbw0H6gevZCP+Fgb2YbEo0YjESbkfCdzBqI/RYognOpFsEYsXt+rH60t8F+s6DtGjeDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"32c46ef851206718474230575449cf1375cc0a8f438624a722672f6dd08a0793","last_reissued_at":"2026-07-05T10:31:57.212768Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:31:57.212768Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Alex Schwing, Bowen Zhang, Chen Chen, Jialing Tong, Lezhi Li, Rui Qian, Tsu-Jui Fu, Wei Liu, Wenze Hu, Xinze Wang, Yinfei Yang","submitted_at":"2025-03-13T17:57:25Z","abstract_excerpt":"In this work, we empirically study Diffusion Transformers (DiTs) for text-to-image generation, focusing on architectural choices, text-conditioning strategies, and training protocols. We evaluate a range of DiT-based architectures--including PixArt-style and MMDiT variants--and compare them with a standard DiT variant which directly processes concatenated text and noise inputs. Surprisingly, our findings reveal that the performance of standard DiT is comparable with those specialized models, while demonstrating superior parameter-efficiency, especially when scaled up. Leveraging the layer-wise"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.10618","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.10618/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.10618","created_at":"2026-07-05T10:31:57.212825+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.10618v2","created_at":"2026-07-05T10:31:57.212825+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.10618","created_at":"2026-07-05T10:31:57.212825+00:00"},{"alias_kind":"pith_short_12","alias_value":"GLCG56CREBTR","created_at":"2026-07-05T10:31:57.212825+00:00"},{"alias_kind":"pith_short_16","alias_value":"GLCG56CREBTRQR2C","created_at":"2026-07-05T10:31:57.212825+00:00"},{"alias_kind":"pith_short_8","alias_value":"GLCG56CR","created_at":"2026-07-05T10:31:57.212825+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.28137","citing_title":"No Safe Dose: How Training Data Drives Unsafe Image Generation","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12011","citing_title":"CaloArt: Large-Patch x-Prediction Diffusion Transformers for High-Granularity Calorimeter Shower Generation","ref_index":68,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN","json":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN.json","graph_json":"https://pith.science/api/pith-number/GLCG56CREBTRQR2CGBLVISOPCN/graph.json","events_json":"https://pith.science/api/pith-number/GLCG56CREBTRQR2CGBLVISOPCN/events.json","paper":"https://pith.science/paper/GLCG56CR"},"agent_actions":{"view_html":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN","download_json":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN.json","view_paper":"https://pith.science/paper/GLCG56CR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.10618&json=true","fetch_graph":"https://pith.science/api/pith-number/GLCG56CREBTRQR2CGBLVISOPCN/graph.json","fetch_events":"https://pith.science/api/pith-number/GLCG56CREBTRQR2CGBLVISOPCN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN/action/storage_attestation","attest_author":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN/action/author_attestation","sign_citation":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN/action/citation_signature","submit_replication":"https://pith.science/pith/GLCG56CREBTRQR2CGBLVISOPCN/action/replication_record"}},"created_at":"2026-07-05T10:31:57.212825+00:00","updated_at":"2026-07-05T10:31:57.212825+00:00"}