{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:EPJWV7UZYF7WOQDBOBKS2XGQW6","short_pith_number":"pith:EPJWV7UZ","schema_version":"1.0","canonical_sha256":"23d36afe99c17f67406170552d5cd0b7a6076ccb785b4a12707018433c5f32b4","source":{"kind":"arxiv","id":"2410.18514","version":3},"attestation_state":"computed","paper":{"title":"Scaling up Masked Diffusion Models on Text","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Chao Du, Chongxuan Li, Fengqi Zhu, Guangtao Zeng, Min Lin, Qian Liu, Shen Nie, Tianyu Pang","submitted_at":"2024-10-24T08:01:22Z","abstract_excerpt":"Masked diffusion models (MDMs) have shown promise in language modeling, yet their scalability and effectiveness in core language tasks, such as text generation and language understanding, remain underexplored. This paper establishes the first scaling law for MDMs, demonstrating a scaling rate comparable to autoregressive models (ARMs) and a relatively small compute gap. Motivated by their scalability, we train a family of MDMs with up to 1.1 billion (B) parameters to systematically evaluate their performance against ARMs of comparable or larger sizes. Fully leveraging the probabilistic formula"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.18514","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-10-24T08:01:22Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"a446b0e4198e626a1fbe9267839150be5a3b7d7f50984513fd1a38928a90454b","abstract_canon_sha256":"2c32918151a0def493fdc2d430d3ea326b3a8d21615359e8c9659262e68cf79d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:21:25.365235Z","signature_b64":"Cm3S8AWGNswSd0gmHDwIQCdAt5ZkjfQZmIk3VJDeipvGXQKTxogQUoQi1uQ7iLn+Tq/tY/AsqS0pRi0WKEtPAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"23d36afe99c17f67406170552d5cd0b7a6076ccb785b4a12707018433c5f32b4","last_reissued_at":"2026-07-05T10:21:25.364706Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:21:25.364706Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Scaling up Masked Diffusion Models on Text","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Chao Du, Chongxuan Li, Fengqi Zhu, Guangtao Zeng, Min Lin, Qian Liu, Shen Nie, Tianyu Pang","submitted_at":"2024-10-24T08:01:22Z","abstract_excerpt":"Masked diffusion models (MDMs) have shown promise in language modeling, yet their scalability and effectiveness in core language tasks, such as text generation and language understanding, remain underexplored. This paper establishes the first scaling law for MDMs, demonstrating a scaling rate comparable to autoregressive models (ARMs) and a relatively small compute gap. Motivated by their scalability, we train a family of MDMs with up to 1.1 billion (B) parameters to systematically evaluate their performance against ARMs of comparable or larger sizes. Fully leveraging the probabilistic formula"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.18514","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.18514/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.18514","created_at":"2026-07-05T10:21:25.364770+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.18514v3","created_at":"2026-07-05T10:21:25.364770+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.18514","created_at":"2026-07-05T10:21:25.364770+00:00"},{"alias_kind":"pith_short_12","alias_value":"EPJWV7UZYF7W","created_at":"2026-07-05T10:21:25.364770+00:00"},{"alias_kind":"pith_short_16","alias_value":"EPJWV7UZYF7WOQDB","created_at":"2026-07-05T10:21:25.364770+00:00"},{"alias_kind":"pith_short_8","alias_value":"EPJWV7UZ","created_at":"2026-07-05T10:21:25.364770+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05722","citing_title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25331","citing_title":"Improved Large Language Diffusion Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01775","citing_title":"Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding","ref_index":105,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08501","citing_title":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27617","citing_title":"Masked Language Flow Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26106","citing_title":"Looped Diffusion Language Models","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31215","citing_title":"Fixed-Point Masked Generative Modeling","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30753","citing_title":"Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08810","citing_title":"Continuous Language Diffusion as a Decoder-Interface Problem","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17497","citing_title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2505.16933","citing_title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2512.09675","citing_title":"d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2512.14067","citing_title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11726","citing_title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12522","citing_title":"Differences in Text Generated by Diffusion and Autoregressive Language Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11726","citing_title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09302","citing_title":"Discrete Langevin-Inspired Posterior Sampling","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09603","citing_title":"Edit-Based Refinement for Parallel Masked Diffusion Language Models","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06548","citing_title":"Continuous Latent Diffusion Language Model","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2508.15487","citing_title":"Dream 7B: Diffusion Large Language Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07193","citing_title":"Coupling Models for One-Step Discrete Generation","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2502.09992","citing_title":"Large Language Diffusion Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18471","citing_title":"NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization","ref_index":35,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6","json":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6.json","graph_json":"https://pith.science/api/pith-number/EPJWV7UZYF7WOQDBOBKS2XGQW6/graph.json","events_json":"https://pith.science/api/pith-number/EPJWV7UZYF7WOQDBOBKS2XGQW6/events.json","paper":"https://pith.science/paper/EPJWV7UZ"},"agent_actions":{"view_html":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6","download_json":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6.json","view_paper":"https://pith.science/paper/EPJWV7UZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.18514&json=true","fetch_graph":"https://pith.science/api/pith-number/EPJWV7UZYF7WOQDBOBKS2XGQW6/graph.json","fetch_events":"https://pith.science/api/pith-number/EPJWV7UZYF7WOQDBOBKS2XGQW6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6/action/storage_attestation","attest_author":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6/action/author_attestation","sign_citation":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6/action/citation_signature","submit_replication":"https://pith.science/pith/EPJWV7UZYF7WOQDBOBKS2XGQW6/action/replication_record"}},"created_at":"2026-07-05T10:21:25.364770+00:00","updated_at":"2026-07-05T10:21:25.364770+00:00"}