Pith. sign in

Paper Citation Record · LEDGER

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

As of 16 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2608.03457.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.03457 v1

Coverage vector

measured 90 of 90 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T14:54:53.254253Z

measured 90 of 90 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

90 of 90 outbound references displayed

  • verified exact0
  • verified fuzzy15
  • unresolved73
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 75965d8d-6ec2-4461-a75e-d3b7e7808433 · outbound

This paper cites Frontiers of Computer Science , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Frontiers of Computer Science , volume=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.931183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.931183Z digest=sha256:cf2a044a07ea32640da6a9c8cf80d386ba43a94f17ed52abf30696eb9c2d8e3b

Observation ba1ac7da-a0f8-40d7-a8e7-6c28e4cd711b · outbound

This paper cites The Llama 3 Herd of Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models The Llama 3 Herd of Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.935452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.935452Z digest=sha256:c631cb27d350ea508058f1b69b8c2199d62151ff442328307efc59248575a543

Observation 6206f049-45b6-4b47-a1f2-057f674e6eeb · outbound

This paper cites Qwen Technical Report.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Qwen Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.939622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.939622Z digest=sha256:e886796c1ffb9743dce56114003b853fac697564a0836dcc328057d56324eb8d

Observation cd1833d1-8ec0-444f-b627-d40ca7dd748f · outbound

This paper cites Qwen3 Technical Report.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Qwen3 Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.943691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.943691Z digest=sha256:30995be3c3188d2ea3de18a75456d093d1829bf1bd0ac604bc8e1d67906375e5

Observation 5120ac24-3eef-4f52-bd86-34eb8fa177e8 · outbound

This paper cites DeepSeek LLM: Scaling Open-Source Language Models with Longtermism.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models DeepSeek LLM: Scaling Open-Source Language Models with Longtermism

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.947620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.947620Z digest=sha256:ca14e189d35bd4c70c3269d2b449f8ce2db7eeae9e656cca19ca0de90f752ee7

Observation dd281ed2-ce47-4d9b-a082-15c36523ae7a · outbound

This paper cites DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.951619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.951619Z digest=sha256:77348b3e23edbcb66ded743e7e236bb5467047b4c2b1a6c613be67cb9a063efd

Observation 18685613-ac2e-4d71-98f0-9e35f00e16c3 · outbound

This paper cites DeepSeek-V3 Technical Report.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models DeepSeek-V3 Technical Report

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.955813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.955813Z digest=sha256:d8e7932beca0256e32df66672d8850f41365372ed503025d41286b92f1ebae4a

Observation c8a59808-a0af-4ca8-a1f1-005b2ad354ce · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.959898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.959898Z digest=sha256:176afbd11bebad812c4828ddc4f07a32b69e315b0f406363d866d27f1f36a9a7

Observation 22eb8403-d854-4463-95c4-ea3e3e228bac · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.963551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.963551Z digest=sha256:1f20a98e89e9e51e98413d8e7685de2d9bb51dd1a4171e3ef2a29103c768a9aa

Observation e15a25f7-5d7c-4e94-969c-221164ee947f · outbound

This paper cites Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.967334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.967334Z digest=sha256:40bd989bdd73b6d898ab28a23de9bb882596a5d97e6c4b5dde95ef3b58cf6478

Observation dc40a1a4-1179-4ad7-a951-9077cd13a1ac · outbound

This paper cites GPT-4 Technical Report.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models GPT-4 Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.970602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.970602Z digest=sha256:9c99969b4cb40d515a04c410224093cce019f2abbe3a153001e7db841d1e6ec2

Observation 1261dea4-a1ef-4ec4-a5d3-77413e3379a1 · outbound

This paper cites Deep Learning Scaling is Predictable, Empirically.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Deep Learning Scaling is Predictable, Empirically

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.974103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.974103Z digest=sha256:8136007f20864fd598f9eb8807cc2faa3c3e64595d28bc2eb13fac9fee53479f

Observation fda5b109-84f8-41fb-ab85-fd56b6105446 · outbound

This paper cites Scaling Laws for Neural Language Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Scaling Laws for Neural Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.978034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.978034Z digest=sha256:c04fe82fc1ef9420f2af1f8c67cb81ac1e6d45282eb865bc8449b77a41e179e6

Observation 86b49540-92cb-4bb8-8f87-6361e045fad3 · outbound

This paper cites Training Compute-Optimal Large Language Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Training Compute-Optimal Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.982080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.982080Z digest=sha256:f9396f778be6a2b629feeb596370c4030e228f8d66cd83d34c334d13a0bc3404

Observation 2efdf051-7fe8-40eb-9fe2-d19777b7cf01 · outbound

This paper cites International conference on machine learning , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International conference on machine learning , pages=

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.986024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.986024Z digest=sha256:db69ae3860e4411cc6c2aece54d45d0bcf844881dfd1baa3bf6a2928f0525534

Observation 9cf074b6-ca93-445b-8e7b-e58043980931 · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.989733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.989733Z digest=sha256:109d225ecae04fafceeafea4e66fceaa30f31084f78fd3040af40dd8b6b8705b

Observation 6084a2e6-0e5a-4548-bbba-024d20f45e6c · outbound

This paper cites Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.993025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.993025Z digest=sha256:e54eade840760a6d64b778282ae61dba5df2a7c87d95c53e783e98176ac9456f

Observation bf369686-e9cc-4ac7-a6b0-1c2076095e8e · outbound

This paper cites Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:52.996839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:52.996839Z digest=sha256:fd95aebd25c32e00db58344726dd208dd97c5f1275cdde224a9cc5acb33beeb8

Observation 2c8905de-c029-4220-9843-7be93689f9a0 · outbound

This paper cites Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.000585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.000585Z digest=sha256:4250fca4811453c6bcd6cdce5b8ab4cfe83b63cdd586b376dd149ad9f4925625

Observation be4cefbc-1fec-42f4-97d1-62342163d75a · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.004168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.004168Z digest=sha256:f98787d037573aa186abc7e14189497ddb4bc4e93e61c3feceecfe0746c9b6f8

Observation 3ba852a8-d13b-4cc7-882b-6c663d6732e0 · outbound

This paper cites 2018 , publisher=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models 2018 , publisher=

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.007719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.007719Z digest=sha256:29b4dc9e12ac80dfcffa46eacaffb11488e3e21f75b1ac1dcc14ad975ff1407f

Observation abe33383-4864-442b-938f-6f8911245f92 · outbound

This paper cites OpenAI blog , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models OpenAI blog , volume=

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.011294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.011294Z digest=sha256:5ef5a37756852514680db64e4598f1c2661a1eaba9213720b1f3348a76ddb673

Observation fc90df4e-66ed-479a-b946-09a2ff8ce8e2 · outbound

This paper cites Advances in neural information processing systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in neural information processing systems , volume=

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.015095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.015095Z digest=sha256:bc646c88d6e7e05860550c0dd0a6df210d382377017a2cae59837bc1a2c29e36

Observation d6e0ba70-a55b-4ca5-ab0c-c4ed9095b594 · outbound

This paper cites Advances in neural information processing systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in neural information processing systems , volume=

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.018393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.018393Z digest=sha256:b163eb8b26fb8849a1011aa251a03f4e1127b3852b1229ac9694ea662ae5e070

Observation bbc2df56-26f8-47c8-a697-d0c3d954d205 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in Neural Information Processing Systems , volume=

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.021652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.021652Z digest=sha256:ba5507bdd37993b94e5c1252bbe128b9e304757a11429ced024e80303f49d97e

Observation b7b2eef6-8930-4cff-a021-6e94b1bfb31b · outbound

This paper cites Advances in neural information processing systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in neural information processing systems , volume=

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.025027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.025027Z digest=sha256:5ebd3921c9ca372cbff0ac06d5b85ca087b102bb70855515e5704015d76ac9d0

Observation 94dde3b9-4d63-44c1-bbe4-9d8e1819f529 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in Neural Information Processing Systems , volume=

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.028466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.028466Z digest=sha256:46388ba3cd901c60f93a516cbfbbe26cb5ff4f19ec37b51adf0eea2d8f6a8fb5

Observation 64391c34-2502-4223-8574-6c02c1046dbb · outbound

This paper cites Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.228695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.032576Z digest=sha256:20fc4afe0784315338b8370415b94e31f2e358ef86203b672c0016e56ef3a250

Observation b5df5b26-3242-4dc1-b488-b105e9f40b5a · outbound

This paper cites Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.036796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.036796Z digest=sha256:ada2b12bf9d9bd803a11d2fc58bd10bd91f5113b261716ba778bded501c111cc

Observation 9ea58332-30cb-4e3a-bf35-893d7d6cdbcd · outbound

This paper cites Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.040691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.040691Z digest=sha256:5004cf972c2cc45543cab3a889240c13fec9ea542139012215d6691ac622191f

Observation 64a39fda-29e4-44dd-9656-95222abf72b7 · outbound

This paper cites Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.044551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.044551Z digest=sha256:be5f4e504d6b9174a58f5733c6f6cf076dc6585008355dcdef8d64b21b15aae0

Observation e47d7054-432e-4b94-82dd-ff89b5a2b5f5 · outbound

This paper cites Advances in neural information processing systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in neural information processing systems , volume=

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.048318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.048318Z digest=sha256:578a80f9dbc5b9748a28b3d440c1c21289c8f0052c3502bb68633903e5f88857

Observation 2d85350a-7c88-4fa0-a872-c05b11f94d12 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in Neural Information Processing Systems , volume=

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.051918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.051918Z digest=sha256:c48d6326afa4f7ca1264bace84b124d2780714d9b56767b0d66cd4d07a384e75

Observation 5df4ee44-4a60-43a5-8a27-60fbae1cd7ca · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.205519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.055822Z digest=sha256:0ced48864abd7fe9e9da81010a7b324cf2782958259cfe2c44744f7b1231f2ab

Observation 6ec388bc-2f80-4282-a437-77eebb97e1f5 · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.194608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.059491Z digest=sha256:1090c9b4e9df9695695fadde410f1481e899fcd07dd893b93a7955388a141ea7

Observation 991f974d-388a-4041-ab5d-0d47ee751760 · outbound

This paper cites arXiv preprint arXiv:2510.03280 , year=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models arXiv preprint arXiv:2510.03280 , year=

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.063186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.063186Z digest=sha256:2693cdf6108be2ebf7d953195bc1f536a6083931412e4d11be14eef4e8b34a0f

Observation ebd66ced-8da8-4cbb-882f-4d0d663ccc9a · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.184057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.066854Z digest=sha256:2f568333d4a9c7d1bbb44c159d3279332e8ff34ee0482a035fc617dd3e84d72e

Observation caef4893-8236-4384-a843-1601999a7d3a · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.070324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.070324Z digest=sha256:a5bd5a1f94fcb25e7084d8ebcd6e82e0a99e5da5c88c81da5b2dd58c5256cd05

Observation b495b72f-0cbf-40d9-9922-322c895a6699 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in Neural Information Processing Systems , volume=

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.073982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.073982Z digest=sha256:e74ad09c10763918b32f4234e2e3c5c08e73976e1a475ec1ab15b177f764a4a6

Observation b928897f-33da-4b3a-b410-5b6577d4c080 · outbound

This paper cites Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.077088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.077088Z digest=sha256:5b527da61591ed9a54d458ca8d9d15bf9b8b713310390cad5475919c2aa3c1f8

Observation 8b4bf501-ab9c-4a01-b38e-4509805f46e5 · outbound

This paper cites Improved Large Language Diffusion Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Improved Large Language Diffusion Models

Reference 41

Resolution
metadata mismatch
local_arxiv, observed 2026-08-15T14:54:53.715349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.080402Z digest=sha256:cbee473dab77b06c00f5abe0d527ecf49567b3291a87d7561a205dc6734ee9ca

Observation e7b3a87d-d071-44f8-9d64-2122bdf209ca · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.153984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.083853Z digest=sha256:67a1bc12ac33943327bf089dce3dc73befe9a052572c6cad9e1146211c5eb7a2

Observation d5cb847b-dddf-4ede-9f40-ccb5db8a54e1 · outbound

This paper cites Dream 7B , url =.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Dream 7B , url =

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.087165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.087165Z digest=sha256:ee9fb83ca75bfd357238afd77ee95c48b128ed05f99030cd310505db935bac34

Observation 6026ebe9-b289-448e-8c25-3cc802fd7b5a · outbound

This paper cites arXiv preprint arXiv:2509.24389 , year=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models arXiv preprint arXiv:2509.24389 , year=

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.090534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.090534Z digest=sha256:c2ee2933b2996289513cc92b9a84ec1b8bf1c127d70df22e23c49f9762085958

Observation e36e7b3b-9ea2-4c3b-9408-063d72d38c08 · outbound

This paper cites Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.094173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.094173Z digest=sha256:bc61b82b11d5891166a9619bbcc4e88bdbe4220ece18b75df8a192428d14e23d

Observation 47124b80-aab9-46b0-8857-a98b7dbd21d8 · outbound

This paper cites Mercury: Ultra-Fast Language Models Based on Diffusion.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Mercury: Ultra-Fast Language Models Based on Diffusion

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.097941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.097941Z digest=sha256:926c4d768caa5c0b4fd4b9fcebe8005237949a08202390e080bb52bd705dbd38

Observation ec5f3e20-305d-4036-9425-4c39d8f7f448 · outbound

This paper cites A Survey on Diffusion Language Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models A Survey on Diffusion Language Models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.102557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.102557Z digest=sha256:1c3c4da84999a53983c43ae25845bf3cced6ff60e090c41464861586d5e0fece

Observation 128f563b-0b1a-45cb-870f-a31c81a7745f · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.106073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.106073Z digest=sha256:d60456bdc4191353ccdadf6f49a2faea16b23331a9d953f78c83f76512ccfb6c

Observation 7947933a-bb29-4922-ac17-10bac9834349 · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.129423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.109809Z digest=sha256:7919d25a08dc529db34b1a16ad2bbbfa234f271520c468e589a70dd43972b37e

Observation 50b3f40e-14c6-4748-9c2e-618650574541 · outbound

This paper cites arXiv e-prints , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models arXiv e-prints , pages=

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.118248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.113077Z digest=sha256:b3478679f42886970964c91fd4b3d5c9e7dfbd11cf8d6ee21d4d0561a9920e8f

Observation bea49905-124e-454d-b4e4-13d014752b44 · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.107425Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.116586Z digest=sha256:622bf24748ce53f17e76881347345e551466df9c47ba35e8b1fcf642a80f1e17

Observation 97df7726-25bc-4991-8e62-b9f26c9b7749 · outbound

This paper cites arXiv preprint arXiv:2602.15014 , year=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models arXiv preprint arXiv:2602.15014 , year=

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.119929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.119929Z digest=sha256:2220df4e7403240de96a0f0084144480f97152094b2fc8a52f2454b0fe904d43

Observation 126e29bf-78bd-4fc2-a8a1-55a52d91e9e3 · outbound

This paper cites LLaDA2.0: Scaling Up Diffusion Language Models to 100B.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models LLaDA2.0: Scaling Up Diffusion Language Models to 100B

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.123132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.123132Z digest=sha256:99e0504e6917e68613e9d7f8a46933e9ed5500bf211054250e93499a577473fe

Observation d857c1f6-a465-4610-ab3f-14ece18875ea · outbound

This paper cites arXiv preprint arXiv:2511.03276 , year=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models arXiv preprint arXiv:2511.03276 , year=

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.126756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.126756Z digest=sha256:fa5ae25018af5772d9e32b9eda5f2f9d103023350262e9b308c23ff5542558e0

Observation 8b974f91-7218-4993-86a9-99f6a18de55e · outbound

This paper cites Findings of the Association for Computational Linguistics: ACL 2026 , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Findings of the Association for Computational Linguistics: ACL 2026 , pages=

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.096808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.130377Z digest=sha256:267263f759a4dce00515b69c322fabe3e5c43e7bf4be7d3aad33448c128de5f7

Observation 04a14416-6abf-4296-a821-17e29a4701d6 · outbound

This paper cites dMoE: dLLMs with Learnable Block Experts.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models dMoE: dLLMs with Learnable Block Experts

Reference 56

Resolution
metadata mismatch
local_arxiv, observed 2026-08-15T14:54:53.464595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.134040Z digest=sha256:05e167173a862cce83fcc0667219d85b5db9d50a7fbe7add2e1b53272bb85205

Observation b202179c-5108-443f-b91e-3c66846ee8b3 · outbound

This paper cites Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.137569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.137569Z digest=sha256:54747285a55b59d9643324b9b6075f40cb43646a221e55bcc428766fafeb9fec

Observation bf0ce0b0-b63b-4f20-b9b8-f61bc24469a3 · outbound

This paper cites DFlash: Block Diffusion for Flash Speculative Decoding.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models DFlash: Block Diffusion for Flash Speculative Decoding

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.141263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.141263Z digest=sha256:5a9a52dd2bedd0e7d27922be03e13a61be83d861995e0192dca6ce03b1731f76

Observation 5ad64725-31d1-4a65-bc11-652075915d36 · outbound

This paper cites DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.144855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.144855Z digest=sha256:485ca5902c3a7e2c74e9b7cc00ad0bc47ecf88e209f4be06791aa87ec1bf007c

Observation ea22e41c-ea76-4029-961d-782f7116a91f · outbound

This paper cites Advances in neural information processing systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in neural information processing systems , volume=

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.148461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.148461Z digest=sha256:7c732cbd0aeb6a3f0471928e5e5897a237b1d13004cff4c6b38e9a578bb3f0ab

Observation 51d4c490-9b38-4c25-a012-5833966ad492 · outbound

This paper cites Decoupled Weight Decay Regularization.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Decoupled Weight Decay Regularization

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.151806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.151806Z digest=sha256:531addcd39a5256a57cec48fa68a3c9881b52774b356dfb63099cd8352565d7a

Observation 845867cb-d805-4ba5-b183-fb495e42741e · outbound

This paper cites GLU Variants Improve Transformer.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models GLU Variants Improve Transformer

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.155681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.155681Z digest=sha256:1f2f8e11edd54ea7af4c0dffb79e5e43236a4db08fe737342f7868403d4e8dfa

Observation ca6b9a35-6527-4bcc-b4cc-22d3c76976e7 · outbound

This paper cites Proceedings of the 2023 conference on empirical methods in natural language processing , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 2023 conference on empirical methods in natural language processing , pages=

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.079835Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.159783Z digest=sha256:377f81952cacec29d0e7c78569901c8591d5adcc11ec4dad27c70945d9ae8e87

Observation 83023f4b-91b7-4c9e-95ac-0af83c8640be · outbound

This paper cites Neurocomputing , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Neurocomputing , volume=

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.163109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.163109Z digest=sha256:108094142d402c48d410238ae3a9b4a6891f806f96088df0c61163f6aa664fec

Observation 95ee070a-6525-461d-8916-4814d13eb6f8 · outbound

This paper cites Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) , pages=

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.062887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.166414Z digest=sha256:0a9eae81805b5063b2e1596ebf790d4108bd142118ab3e9896255c533949aef2

Observation 02e049a8-2cec-46aa-ab57-c6bb771b34fa · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.051623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.169811Z digest=sha256:cd1832cb66814cc3f5eb84d0b29c1264f11b4fa5edaed773289610e29f8b19d4

Observation 1bc886c4-2d67-4239-9e0a-ad01dd08c488 · outbound

This paper cites Scaling Laws for Fine-Grained Mixture of Experts.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Scaling Laws for Fine-Grained Mixture of Experts

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.172947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.172947Z digest=sha256:4062c53b86f36a38066499a52c99a9532da35d5ae43f77bf69437032531f4c54

Observation 22173e29-ed15-4a68-86f5-71243fd2025f · outbound

This paper cites Mixtral of Experts.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Mixtral of Experts

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.176291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.176291Z digest=sha256:1985707c63b1aa55af54d34ff8f0431c9384d799a43a1e8dd60dce8ebc2a0d05

Observation d685a404-6ba5-4865-ad6a-a285e8e854f5 · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.179929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.179929Z digest=sha256:c9b7e2a7c5fd7a0bffd2d3d61fb94b158011c187f379e1bf685289e26f40b455

Observation eae97c02-4547-4bfa-835f-624bdc6a14a2 · outbound

This paper cites GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.183723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.183723Z digest=sha256:10ad891b213e2f5c346b037bfd4884e6b3ad4f1dc920791b0db554ad9b03e0ad

Observation c13e2aa1-c830-4d9c-a9e9-2e35a3a3dd22 · outbound

This paper cites Journal of Machine Learning Research , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Journal of Machine Learning Research , volume=

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.187768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.187768Z digest=sha256:f75f90089eceb42f7982ceb9b3433fcbfc372bdcdfc85d754425b941a59bf2e3

Observation 604ca863-9c4e-4f37-97f2-8fcb9b3ec316 · outbound

This paper cites Neural computation , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Neural computation , volume=

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.191060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.191060Z digest=sha256:5c8c9625c5e0bc6e5ed949d6db578b75f3df936bdc4014da215de8657d158ed1

Observation 947ee811-a441-43d6-8425-c789a6daaf12 · outbound

This paper cites ST-MoE: Designing Stable and Transferable Sparse Expert Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models ST-MoE: Designing Stable and Transferable Sparse Expert Models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.194432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.194432Z digest=sha256:164caa8207500af4005edf318ce470b05edbb44cc0510e983e0461d82e18be84

Observation fa441e14-d273-402f-bbd2-6bf854e1bf70 · outbound

This paper cites Muon is Scalable for LLM Training.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Muon is Scalable for LLM Training

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.197951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.197951Z digest=sha256:27ee47845c46eb5863c6c3848541be7941fb7d1274692224f0bb4092b48eff4c

Observation a5a3322d-bf8b-4b3f-9a36-1a3258859e74 · outbound

This paper cites International conference on machine learning , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International conference on machine learning , pages=

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.201763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.201763Z digest=sha256:11ad242725a56d2646d93c70b3835b6b2bd5a7f4d9f8fb0bdbaf6bb1161ac6a5

Observation 95d0a104-3ced-46eb-a038-32bfc6212eaf · outbound

This paper cites Measuring Massive Multitask Language Understanding.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Measuring Massive Multitask Language Understanding

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.205217Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.205217Z digest=sha256:f66d2f07c561a8602e01d18c9a9fafa253541663b37398828d26a53b84f1fa6e

Observation 2422a981-6b46-49d5-b684-b18badab8041 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in Neural Information Processing Systems , volume=

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.208822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.208822Z digest=sha256:cd713d42eb01fb2fecd901cc112baf446b564f57bb3f318fca09a56751b774c4

Observation bc595300-3fab-4f3c-ad36-40fc9555a072 · outbound

This paper cites Advances in neural information processing systems , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Advances in neural information processing systems , volume=

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.014803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.211938Z digest=sha256:9ac3174152bea200cf6d12ea9a486882f77fe5d1cfafb47c1bd1972d9a48a9ac

Observation 0bc3ffe4-4c02-428f-951e-5f4f451b8726 · outbound

This paper cites Findings of the Association for Computational Linguistics: ACL 2024 , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Findings of the Association for Computational Linguistics: ACL 2024 , pages=

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:54.003972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.216328Z digest=sha256:2f2560ca7806a1d6f3c8f5850f75201ef2d6845c30c18007de7af9a2062e0465

Observation b3c605a8-5ef1-4cc7-a74b-24060c9b396e · outbound

This paper cites Proceedings of the 57th annual meeting of the association for computational linguistics , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 57th annual meeting of the association for computational linguistics , pages=

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.219903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.219903Z digest=sha256:68ffa721ab13f4b7f23cf4c36b9d74bc213991351d839d71d67d22fdfe92fd71

Observation 4d43f2dc-96b1-485a-80b2-636aafdc4cb3 · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T14:54:53.986631Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-15T14:54:53.223215Z digest=sha256:8dd05748991ada1da5e36448a76b30924f4d066427885b08d29157b1cef25838

Observation 1d8e1eb1-a840-4bc0-9732-e8513ee7ae0c · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Training Verifiers to Solve Math Word Problems

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.226271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.226271Z digest=sha256:1b718e3b708dab943e9eefab5afb84c1be8a8e8fdaecbfbb9f7ed0b309457151

Observation bd29b304-ae32-42cc-b23f-6dc2f5032224 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.229762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.229762Z digest=sha256:00df52952e359f3c0556c95ee72973d0aa7b63a8c56026594d6c9234c6ed782d

Observation a96fb5dc-0f73-45d4-8c81-af9c6890ee5f · outbound

This paper cites Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.233320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.233320Z digest=sha256:900118ff3b3cb3858ed176d6ff5842ea2d34f01d8c88a49c11d6061cc7bf5091

Observation bed8744b-f7a2-4afe-bb78-b81373ef9f4c · outbound

This paper cites CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.236855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.236855Z digest=sha256:2ff5e6739990ebf547e89e272b0774c2ea82353915ab0504316b803604a9abcc

Observation 4ae4e16c-ad30-4a66-af79-3e4389f958de · outbound

This paper cites Program Synthesis with Large Language Models.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Program Synthesis with Large Language Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.240344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.240344Z digest=sha256:96a9d6a14d43ca85e1945e7df14781ea91fe677896ea416a14641b53f6f91913

Observation 878ca4bd-0806-4965-b514-8313bea22b41 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.244102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.244102Z digest=sha256:c1eff17c66fbdcd78f996ff0b3da60c9df0483f2b84d63cf07a75794604ea73f

Observation e3938718-344f-4cad-977e-a9f1ba294cc7 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Evaluating Large Language Models Trained on Code

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.247943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.247943Z digest=sha256:5bc8a5d298c64de35ac470f7726fcb261f9fdd4ef9ce67fd096b33f42f7130b4

Observation 323cffd1-091f-470a-9e22-088ea29f9bd3 · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.251157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.251157Z digest=sha256:102c99a34f4a23f8fcf063ef25d1a69bc508127743f5344428d5b843e31a136c

Observation 1e354280-3689-4878-b3df-4cfb7fe5d97d · outbound

This paper cites International Conference on Learning Representations , volume=.

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models International Conference on Learning Representations , volume=

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-15T14:54:53.254253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:54:53.254253Z digest=sha256:6cc331a9f785567af99a9064d918d015538d4d07f312a4cb3f5cfd501b319e13

Pith citing papers

No inbound Pith citation observations are available.