{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:3AVYUXBB2CATNEZ46HTNSPZMWT","short_pith_number":"pith:3AVYUXBB","schema_version":"1.0","canonical_sha256":"d82b8a5c21d08136933cf1e6d93f2cb4e4aeed555f75701cb3f9d17e3bb79a1c","source":{"kind":"arxiv","id":"2211.04236","version":1},"attestation_state":"computed","paper":{"title":"Self-conditioned Embedding Diffusion for Text Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Arthur Mensch, Corentin Tallec, Florent Altch\\'e, Laurent Sifre, Nikolay Savinov, R\\'emi Leblond, Robin Strudel, Sander Dieleman, Will Grathwohl, Yaroslav Ganin, Yilun Du","submitted_at":"2022-11-08T13:30:27Z","abstract_excerpt":"Can continuous diffusion models bring the same performance breakthrough on natural language they did for image generation? To circumvent the discrete nature of text data, we can simply project tokens in a continuous space of embeddings, as is standard in language modeling. We propose Self-conditioned Embedding Diffusion, a continuous diffusion mechanism that operates on token embeddings and allows to learn flexible and scalable diffusion models for both conditional and unconditional text generation. Through qualitative and quantitative evaluation, we show that our text diffusion models generat"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2211.04236","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2022-11-08T13:30:27Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"3fdac587e33d5d8b374cb62d5fcba3044707739f02dc71f9a4ae954f2fde64de","abstract_canon_sha256":"2e72a0614d30a3205622648d7dc71d5f2920676553eac8f429c41d9ae39d98d2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:14:27.402350Z","signature_b64":"HejVMEuqTYhaFVdNR7gLGdQU3FIJLoE/F+YtKEV0QQv22QYSY4x8ySqB6tUZRDjizMnhgS0W1oorPGrsLkxRCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d82b8a5c21d08136933cf1e6d93f2cb4e4aeed555f75701cb3f9d17e3bb79a1c","last_reissued_at":"2026-07-05T05:14:27.401856Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:14:27.401856Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Self-conditioned Embedding Diffusion for Text Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Arthur Mensch, Corentin Tallec, Florent Altch\\'e, Laurent Sifre, Nikolay Savinov, R\\'emi Leblond, Robin Strudel, Sander Dieleman, Will Grathwohl, Yaroslav Ganin, Yilun Du","submitted_at":"2022-11-08T13:30:27Z","abstract_excerpt":"Can continuous diffusion models bring the same performance breakthrough on natural language they did for image generation? To circumvent the discrete nature of text data, we can simply project tokens in a continuous space of embeddings, as is standard in language modeling. We propose Self-conditioned Embedding Diffusion, a continuous diffusion mechanism that operates on token embeddings and allows to learn flexible and scalable diffusion models for both conditional and unconditional text generation. Through qualitative and quantitative evaluation, we show that our text diffusion models generat"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2211.04236","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2211.04236/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2211.04236","created_at":"2026-07-05T05:14:27.401908+00:00"},{"alias_kind":"arxiv_version","alias_value":"2211.04236v1","created_at":"2026-07-05T05:14:27.401908+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2211.04236","created_at":"2026-07-05T05:14:27.401908+00:00"},{"alias_kind":"pith_short_12","alias_value":"3AVYUXBB2CAT","created_at":"2026-07-05T05:14:27.401908+00:00"},{"alias_kind":"pith_short_16","alias_value":"3AVYUXBB2CATNEZ4","created_at":"2026-07-05T05:14:27.401908+00:00"},{"alias_kind":"pith_short_8","alias_value":"3AVYUXBB","created_at":"2026-07-05T05:14:27.401908+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01775","citing_title":"Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01774","citing_title":"Subliminal Clocks: Latent Time Modelling in Diffusion Language Models","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08417","citing_title":"Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00588","citing_title":"Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00714","citing_title":"Self-conditioned Flow Map Language Models via Fixed-point Flows","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14531","citing_title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10938","citing_title":"ELF: Embedded Language Flows","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22586","citing_title":"A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24173","citing_title":"Extracting Training Data from Diffusion Language Models via Infilling","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2502.17119","citing_title":"Diffusion and Flow Matching Models for Tabular Data: A Survey","ref_index":140,"is_internal_anchor":false},{"citing_arxiv_id":"2602.16813","citing_title":"Flow Map Language Models: One-step Language Modeling via Continuous Denoising","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18530","citing_title":"Continuous Diffusion Scales Competitively with Discrete Diffusion for Language","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19726","citing_title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14531","citing_title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2406.03736","citing_title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2505.16933","citing_title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2602.16813","citing_title":"Flow Map Language Models: One-step Language Modeling via Continuous Denoising","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14531","citing_title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12836","citing_title":"Discrete Stochastic Localization for Non-autoregressive Generation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11577","citing_title":"BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10938","citing_title":"ELF: Embedded Language Flows","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26985","citing_title":"Simple Self-Conditioning Adaptation for Masked Diffusion Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06548","citing_title":"Continuous Latent Diffusion Language Model","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2502.09992","citing_title":"Large Language Diffusion Models","ref_index":45,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT","json":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT.json","graph_json":"https://pith.science/api/pith-number/3AVYUXBB2CATNEZ46HTNSPZMWT/graph.json","events_json":"https://pith.science/api/pith-number/3AVYUXBB2CATNEZ46HTNSPZMWT/events.json","paper":"https://pith.science/paper/3AVYUXBB"},"agent_actions":{"view_html":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT","download_json":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT.json","view_paper":"https://pith.science/paper/3AVYUXBB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2211.04236&json=true","fetch_graph":"https://pith.science/api/pith-number/3AVYUXBB2CATNEZ46HTNSPZMWT/graph.json","fetch_events":"https://pith.science/api/pith-number/3AVYUXBB2CATNEZ46HTNSPZMWT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT/action/storage_attestation","attest_author":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT/action/author_attestation","sign_citation":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT/action/citation_signature","submit_replication":"https://pith.science/pith/3AVYUXBB2CATNEZ46HTNSPZMWT/action/replication_record"}},"created_at":"2026-07-05T05:14:27.401908+00:00","updated_at":"2026-07-05T05:14:27.401908+00:00"}