{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:3VRCM3WRJISTCIEUMJG6OMV6JJ","short_pith_number":"pith:3VRCM3WR","schema_version":"1.0","canonical_sha256":"dd62266ed14a25312094624de732be4a72581951e85920f69780f882dd1192d2","source":{"kind":"arxiv","id":"2303.14389","version":2},"attestation_state":"computed","paper":{"title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ming-Ming Cheng, Pan Zhou, Shanghua Gao, Shuicheng Yan","submitted_at":"2023-03-25T07:47:21Z","abstract_excerpt":"Despite its success in image synthesis, we observe that diffusion probabilistic models (DPMs) often lack contextual reasoning ability to learn the relations among object parts in an image, leading to a slow learning process. To solve this issue, we propose a Masked Diffusion Transformer (MDT) that introduces a mask latent modeling scheme to explicitly enhance the DPMs' ability to contextual relation learning among object semantic parts in an image. During training, MDT operates in the latent space to mask certain tokens. Then, an asymmetric diffusion transformer is designed to predict masked t"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2303.14389","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2023-03-25T07:47:21Z","cross_cats_sorted":[],"title_canon_sha256":"9d92ca0ec65f255ebba95535c5f5cfb46f3480deb64700f2eb4ce40284b01251","abstract_canon_sha256":"db7646db6a546c095d383e62d59436a698bb99b8445d831d834d5e06a227ac30"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:47:42.799426Z","signature_b64":"E5BFuvTziEKgbH0s58Yzi19athLv/NfZuBDTXdvDBXYVxtMjS9OgNUh833uux/vwmKOtt9vD2SIFSMAN0EN2CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dd62266ed14a25312094624de732be4a72581951e85920f69780f882dd1192d2","last_reissued_at":"2026-07-05T07:47:42.798845Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:47:42.798845Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ming-Ming Cheng, Pan Zhou, Shanghua Gao, Shuicheng Yan","submitted_at":"2023-03-25T07:47:21Z","abstract_excerpt":"Despite its success in image synthesis, we observe that diffusion probabilistic models (DPMs) often lack contextual reasoning ability to learn the relations among object parts in an image, leading to a slow learning process. To solve this issue, we propose a Masked Diffusion Transformer (MDT) that introduces a mask latent modeling scheme to explicitly enhance the DPMs' ability to contextual relation learning among object semantic parts in an image. During training, MDT operates in the latent space to mask certain tokens. Then, an asymmetric diffusion transformer is designed to predict masked t"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2303.14389","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2303.14389/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2303.14389","created_at":"2026-07-05T07:47:42.798917+00:00"},{"alias_kind":"arxiv_version","alias_value":"2303.14389v2","created_at":"2026-07-05T07:47:42.798917+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.14389","created_at":"2026-07-05T07:47:42.798917+00:00"},{"alias_kind":"pith_short_12","alias_value":"3VRCM3WRJIST","created_at":"2026-07-05T07:47:42.798917+00:00"},{"alias_kind":"pith_short_16","alias_value":"3VRCM3WRJISTCIEU","created_at":"2026-07-05T07:47:42.798917+00:00"},{"alias_kind":"pith_short_8","alias_value":"3VRCM3WR","created_at":"2026-07-05T07:47:42.798917+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24888","citing_title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08788","citing_title":"MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.32039","citing_title":"GEAR: Guided End-to-End AutoRegression for Image Synthesis","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18267","citing_title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21981","citing_title":"RiT: Vanilla Diffusion Transformers Suffice in Representation Space","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18267","citing_title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16949","citing_title":"Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2506.13763","citing_title":"Diagnosing and Improving Diffusion Models by Estimating the Optimal Loss Value","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2310.05737","citing_title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","ref_index":280,"is_internal_anchor":false},{"citing_arxiv_id":"2402.17177","citing_title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2410.06940","citing_title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","ref_index":135,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10790","citing_title":"Elucidating Representation Degradation Problem in Diffusion Model Training","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15521","citing_title":"Frequency-Aware Flow Matching for High-Quality Image Generation","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ","json":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ.json","graph_json":"https://pith.science/api/pith-number/3VRCM3WRJISTCIEUMJG6OMV6JJ/graph.json","events_json":"https://pith.science/api/pith-number/3VRCM3WRJISTCIEUMJG6OMV6JJ/events.json","paper":"https://pith.science/paper/3VRCM3WR"},"agent_actions":{"view_html":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ","download_json":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ.json","view_paper":"https://pith.science/paper/3VRCM3WR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2303.14389&json=true","fetch_graph":"https://pith.science/api/pith-number/3VRCM3WRJISTCIEUMJG6OMV6JJ/graph.json","fetch_events":"https://pith.science/api/pith-number/3VRCM3WRJISTCIEUMJG6OMV6JJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ/action/storage_attestation","attest_author":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ/action/author_attestation","sign_citation":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ/action/citation_signature","submit_replication":"https://pith.science/pith/3VRCM3WRJISTCIEUMJG6OMV6JJ/action/replication_record"}},"created_at":"2026-07-05T07:47:42.798917+00:00","updated_at":"2026-07-05T07:47:42.798917+00:00"}