{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NZ7T6YEFRX3YGC7KKPVBOD74UE","short_pith_number":"pith:NZ7T6YEF","schema_version":"1.0","canonical_sha256":"6e7f3f60858df7830bea53ea170ffca1330aef85dc1dd1ea172a6b3ddde120ff","source":{"kind":"arxiv","id":"2506.19935","version":1},"attestation_state":"computed","paper":{"title":"Any-Order GPT as Masked Diffusion Model: Decoupling Formulation and Architecture","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","stat.ML"],"primary_cat":"cs.LG","authors_text":"Jiacheng Sun, Kenji Kawaguchi, Shuchen Xue, Tianyang Hu, Tianyu Xie, Zhenguo Li, Zhi-Ming Ma, Zijin Feng","submitted_at":"2025-06-24T18:22:25Z","abstract_excerpt":"Large language models (LLMs) predominantly use autoregressive (AR) approaches, but masked diffusion models (MDMs) are emerging as viable alternatives. A key challenge in comparing AR and MDM paradigms is their typical architectural difference: AR models are often decoder-only, while MDMs have largely been encoder-only. This practice of changing both the modeling paradigm and architecture simultaneously makes direct comparisons unfair, as it's hard to distinguish whether observed differences stem from the paradigm itself or the architectural shift. This research evaluates MDMs within a decoder-"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.19935","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-24T18:22:25Z","cross_cats_sorted":["cs.CV","stat.ML"],"title_canon_sha256":"32e86b306123ad14e01ac046d760461117d7ced59f251f24043c69f505c4a294","abstract_canon_sha256":"600b0de6b8d069f3632fbb8761f6ca267d8fda2b3900b614af66805b95cdeb88"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:26:56.113815Z","signature_b64":"1cC07hvojZxpzKX201m7Y5g+2OrgB9PMmqm4kRtdKT2Jbqg6eMI2bILjMuur5wqXf2O+GafrTEqFrlfhv7X7CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6e7f3f60858df7830bea53ea170ffca1330aef85dc1dd1ea172a6b3ddde120ff","last_reissued_at":"2026-07-05T11:26:56.113334Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:26:56.113334Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Any-Order GPT as Masked Diffusion Model: Decoupling Formulation and Architecture","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","stat.ML"],"primary_cat":"cs.LG","authors_text":"Jiacheng Sun, Kenji Kawaguchi, Shuchen Xue, Tianyang Hu, Tianyu Xie, Zhenguo Li, Zhi-Ming Ma, Zijin Feng","submitted_at":"2025-06-24T18:22:25Z","abstract_excerpt":"Large language models (LLMs) predominantly use autoregressive (AR) approaches, but masked diffusion models (MDMs) are emerging as viable alternatives. A key challenge in comparing AR and MDM paradigms is their typical architectural difference: AR models are often decoder-only, while MDMs have largely been encoder-only. This practice of changing both the modeling paradigm and architecture simultaneously makes direct comparisons unfair, as it's hard to distinguish whether observed differences stem from the paradigm itself or the architectural shift. This research evaluates MDMs within a decoder-"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.19935","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.19935/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.19935","created_at":"2026-07-05T11:26:56.113390+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.19935v1","created_at":"2026-07-05T11:26:56.113390+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.19935","created_at":"2026-07-05T11:26:56.113390+00:00"},{"alias_kind":"pith_short_12","alias_value":"NZ7T6YEFRX3Y","created_at":"2026-07-05T11:26:56.113390+00:00"},{"alias_kind":"pith_short_16","alias_value":"NZ7T6YEFRX3YGC7K","created_at":"2026-07-05T11:26:56.113390+00:00"},{"alias_kind":"pith_short_8","alias_value":"NZ7T6YEF","created_at":"2026-07-05T11:26:56.113390+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05722","citing_title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","ref_index":6,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01775","citing_title":"Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding","ref_index":106,"is_internal_anchor":false},{"citing_arxiv_id":"2510.09885","citing_title":"Diffusion-Inspired Masked Fine-Tuning for Knowledge Injection in Autoregressive LLMs","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2512.14067","citing_title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE","json":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE.json","graph_json":"https://pith.science/api/pith-number/NZ7T6YEFRX3YGC7KKPVBOD74UE/graph.json","events_json":"https://pith.science/api/pith-number/NZ7T6YEFRX3YGC7KKPVBOD74UE/events.json","paper":"https://pith.science/paper/NZ7T6YEF"},"agent_actions":{"view_html":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE","download_json":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE.json","view_paper":"https://pith.science/paper/NZ7T6YEF","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.19935&json=true","fetch_graph":"https://pith.science/api/pith-number/NZ7T6YEFRX3YGC7KKPVBOD74UE/graph.json","fetch_events":"https://pith.science/api/pith-number/NZ7T6YEFRX3YGC7KKPVBOD74UE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE/action/storage_attestation","attest_author":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE/action/author_attestation","sign_citation":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE/action/citation_signature","submit_replication":"https://pith.science/pith/NZ7T6YEFRX3YGC7KKPVBOD74UE/action/replication_record"}},"created_at":"2026-07-05T11:26:56.113390+00:00","updated_at":"2026-07-05T11:26:56.113390+00:00"}