{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:DV5SEDXPYERNOCV2DRJHZ2PR24","short_pith_number":"pith:DV5SEDXP","schema_version":"1.0","canonical_sha256":"1d7b220eefc122d70aba1c527ce9f1d71430606a645320a0cf8c563edd36f7d4","source":{"kind":"arxiv","id":"2212.13771","version":1},"attestation_state":"computed","paper":{"title":"Exploring Vision Transformers as Diffusion Learners","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"He Cao, Jianan Wang, Lei Zhang, Tianhe Ren, Xianbiao Qi, Yihao Chen, Yuan Yao","submitted_at":"2022-12-28T10:32:59Z","abstract_excerpt":"Score-based diffusion models have captured widespread attention and funded fast progress of recent vision generative tasks. In this paper, we focus on diffusion model backbone which has been much neglected before. We systematically explore vision Transformers as diffusion learners for various generative tasks. With our improvements the performance of vanilla ViT-based backbone (IU-ViT) is boosted to be on par with traditional U-Net-based methods. We further provide a hypothesis on the implication of disentangling the generative backbone as an encoder-decoder structure and show proof-of-concept"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2212.13771","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2022-12-28T10:32:59Z","cross_cats_sorted":[],"title_canon_sha256":"8299801fa9d4f9535c07249873c5b3198b727dd8d6e34149b90af0bc77ad28e9","abstract_canon_sha256":"53bbf65d92f5350cfb04e9761bbd478d145c56ca35ecfb03f917cac155670d2e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:28:54.901172Z","signature_b64":"YjL62VIlUWXRNK3QKayWl8+3IMoT35fNNKmx+SZEhxqI3S85KKO1veCCAzVkQTKDG/R9Ilw+TLvcMtlMJxtMAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1d7b220eefc122d70aba1c527ce9f1d71430606a645320a0cf8c563edd36f7d4","last_reissued_at":"2026-07-05T05:28:54.900718Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:28:54.900718Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Exploring Vision Transformers as Diffusion Learners","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"He Cao, Jianan Wang, Lei Zhang, Tianhe Ren, Xianbiao Qi, Yihao Chen, Yuan Yao","submitted_at":"2022-12-28T10:32:59Z","abstract_excerpt":"Score-based diffusion models have captured widespread attention and funded fast progress of recent vision generative tasks. In this paper, we focus on diffusion model backbone which has been much neglected before. We systematically explore vision Transformers as diffusion learners for various generative tasks. With our improvements the performance of vanilla ViT-based backbone (IU-ViT) is boosted to be on par with traditional U-Net-based methods. We further provide a hypothesis on the implication of disentangling the generative backbone as an encoder-decoder structure and show proof-of-concept"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2212.13771","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2212.13771/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2212.13771","created_at":"2026-07-05T05:28:54.900771+00:00"},{"alias_kind":"arxiv_version","alias_value":"2212.13771v1","created_at":"2026-07-05T05:28:54.900771+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2212.13771","created_at":"2026-07-05T05:28:54.900771+00:00"},{"alias_kind":"pith_short_12","alias_value":"DV5SEDXPYERN","created_at":"2026-07-05T05:28:54.900771+00:00"},{"alias_kind":"pith_short_16","alias_value":"DV5SEDXPYERNOCV2","created_at":"2026-07-05T05:28:54.900771+00:00"},{"alias_kind":"pith_short_8","alias_value":"DV5SEDXP","created_at":"2026-07-05T05:28:54.900771+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2412.05628","citing_title":"Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising","ref_index":4,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24","json":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24.json","graph_json":"https://pith.science/api/pith-number/DV5SEDXPYERNOCV2DRJHZ2PR24/graph.json","events_json":"https://pith.science/api/pith-number/DV5SEDXPYERNOCV2DRJHZ2PR24/events.json","paper":"https://pith.science/paper/DV5SEDXP"},"agent_actions":{"view_html":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24","download_json":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24.json","view_paper":"https://pith.science/paper/DV5SEDXP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2212.13771&json=true","fetch_graph":"https://pith.science/api/pith-number/DV5SEDXPYERNOCV2DRJHZ2PR24/graph.json","fetch_events":"https://pith.science/api/pith-number/DV5SEDXPYERNOCV2DRJHZ2PR24/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24/action/storage_attestation","attest_author":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24/action/author_attestation","sign_citation":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24/action/citation_signature","submit_replication":"https://pith.science/pith/DV5SEDXPYERNOCV2DRJHZ2PR24/action/replication_record"}},"created_at":"2026-07-05T05:28:54.900771+00:00","updated_at":"2026-07-05T05:28:54.900771+00:00"}