{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:REZP2W56KEM3EVK6UJKYEWLFJU","short_pith_number":"pith:REZP2W56","schema_version":"1.0","canonical_sha256":"8932fd5bbe5119b2555ea2558259654d1898bbab52509a8ff0f002663de15bb2","source":{"kind":"arxiv","id":"2208.07791","version":1},"attestation_state":"computed","paper":{"title":"Your ViT is Secretly a Hybrid Discriminative-Generative Diffusion Model","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Sheng-Min Shih, Shihao Ji, Xiaoting Zhao, Xiulong Yang, Yinlin Fu","submitted_at":"2022-08-16T15:02:21Z","abstract_excerpt":"Diffusion Denoising Probability Models (DDPM) and Vision Transformer (ViT) have demonstrated significant progress in generative tasks and discriminative tasks, respectively, and thus far these models have largely been developed in their own domains. In this paper, we establish a direct connection between DDPM and ViT by integrating the ViT architecture into DDPM, and introduce a new generative model called Generative ViT (GenViT). The modeling flexibility of ViT enables us to further extend GenViT to hybrid discriminative-generative modeling, and introduce a Hybrid ViT (HybViT). Our work is am"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2208.07791","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2022-08-16T15:02:21Z","cross_cats_sorted":[],"title_canon_sha256":"84e463ba2642572fae4d0a6f16c680949d696f43c14f4d76837ebbfd3c878788","abstract_canon_sha256":"88a4b84174f05c58e177903fc1853e938b409926a543a4c82b93a5156960f17c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:49:09.069032Z","signature_b64":"novtDwUke+yhHMbLGhMlYeJkTaQmeE520KmbX7o10nTm7E6PWOaOVCKKDENhjxupma7MeuieQWK/bcC5oByRDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8932fd5bbe5119b2555ea2558259654d1898bbab52509a8ff0f002663de15bb2","last_reissued_at":"2026-07-05T04:49:09.068570Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:49:09.068570Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Your ViT is Secretly a Hybrid Discriminative-Generative Diffusion Model","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Sheng-Min Shih, Shihao Ji, Xiaoting Zhao, Xiulong Yang, Yinlin Fu","submitted_at":"2022-08-16T15:02:21Z","abstract_excerpt":"Diffusion Denoising Probability Models (DDPM) and Vision Transformer (ViT) have demonstrated significant progress in generative tasks and discriminative tasks, respectively, and thus far these models have largely been developed in their own domains. In this paper, we establish a direct connection between DDPM and ViT by integrating the ViT architecture into DDPM, and introduce a new generative model called Generative ViT (GenViT). The modeling flexibility of ViT enables us to further extend GenViT to hybrid discriminative-generative modeling, and introduce a Hybrid ViT (HybViT). Our work is am"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2208.07791","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2208.07791/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2208.07791","created_at":"2026-07-05T04:49:09.068636+00:00"},{"alias_kind":"arxiv_version","alias_value":"2208.07791v1","created_at":"2026-07-05T04:49:09.068636+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2208.07791","created_at":"2026-07-05T04:49:09.068636+00:00"},{"alias_kind":"pith_short_12","alias_value":"REZP2W56KEM3","created_at":"2026-07-05T04:49:09.068636+00:00"},{"alias_kind":"pith_short_16","alias_value":"REZP2W56KEM3EVK6","created_at":"2026-07-05T04:49:09.068636+00:00"},{"alias_kind":"pith_short_8","alias_value":"REZP2W56","created_at":"2026-07-05T04:49:09.068636+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2410.06940","citing_title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","ref_index":198,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07327","citing_title":"Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU","json":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU.json","graph_json":"https://pith.science/api/pith-number/REZP2W56KEM3EVK6UJKYEWLFJU/graph.json","events_json":"https://pith.science/api/pith-number/REZP2W56KEM3EVK6UJKYEWLFJU/events.json","paper":"https://pith.science/paper/REZP2W56"},"agent_actions":{"view_html":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU","download_json":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU.json","view_paper":"https://pith.science/paper/REZP2W56","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2208.07791&json=true","fetch_graph":"https://pith.science/api/pith-number/REZP2W56KEM3EVK6UJKYEWLFJU/graph.json","fetch_events":"https://pith.science/api/pith-number/REZP2W56KEM3EVK6UJKYEWLFJU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU/action/storage_attestation","attest_author":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU/action/author_attestation","sign_citation":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU/action/citation_signature","submit_replication":"https://pith.science/pith/REZP2W56KEM3EVK6UJKYEWLFJU/action/replication_record"}},"created_at":"2026-07-05T04:49:09.068636+00:00","updated_at":"2026-07-05T04:49:09.068636+00:00"}