{"as_of":"2026-08-16T10:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfc54527b4b813d487275533b560d7852080ae6892b7408f5f981be89ffb4b54","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:54:53.254253Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03457/citation-record","integrity":"/paper/2608.03457/integrity","json":"/paper/2608.03457/citation-record.json","paper":"/paper/2608.03457"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:52.931183Z","title":"Frontiers of Computer Science , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.931183Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:c8aff61fb40f810401ee52fd0d5682033a4c1205472aed441540d1c74698b13d","observation_id":"75965d8d-6ec2-4461-a75e-d3b7e7808433","resolution":{"observed_at":"2026-08-15T14:54:52.931183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T14:54:52.935452Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.935452Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:7dedb969d9c172b6c747423d6162a5a1bf6e4ea3d674730609527f483386c5a5","observation_id":"ba1ac7da-a0f8-40d7-a8e7-6c28e4cd711b","resolution":{"observed_at":"2026-08-15T14:54:52.935452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T14:54:52.939622Z","title":"arXiv preprint arXiv:2309.16609 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.939622Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:eedb1f8b4adb6e37552a189e106ae11e25bea2bcfa5810037270bb893f5216e8","observation_id":"6206f049-45b6-4b47-a1f2-057f674e6eeb","resolution":{"observed_at":"2026-08-15T14:54:52.939622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T14:54:52.943691Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.943691Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:399859d1301f9b27eebe5e1f5dacbe411e7fb2f14c54ae59e6deef6b63af6171","observation_id":"cd1833d1-8ec0-444f-b627-d40ca7dd748f","resolution":{"observed_at":"2026-08-15T14:54:52.943691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-15T14:54:52.947620Z","title":"arXiv preprint arXiv:2401.02954 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.947620Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:049020f9162340842f6c4a9ccbffa6982fc033c13e9c943af4da569e9fdd4e52","observation_id":"5120ac24-3eef-4f52-bd86-34eb8fa177e8","resolution":{"observed_at":"2026-08-15T14:54:52.947620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T14:54:52.951619Z","title":"arXiv preprint arXiv:2405.04434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.951619Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:491df514905a46a78bd93832245ca79a192fac7c89abf48201cfde8a10f09f1a","observation_id":"dd281ed2-ce47-4d9b-a082-15c36523ae7a","resolution":{"observed_at":"2026-08-15T14:54:52.951619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T14:54:52.955813Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.955813Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:8e9dd1fb870d1740210601cb3ef38a19d8c1d1eb6aaf9654266d88a498807c02","observation_id":"18685613-ac2e-4d71-98f0-9e35f00e16c3","resolution":{"observed_at":"2026-08-15T14:54:52.955813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T14:54:52.959898Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.959898Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:2e24f784f3ecfdbaa9f6ed602c63145e0de5500a10b7a8f3f70d0b0a9ca10aeb","observation_id":"c8a59808-a0af-4ca8-a1f1-005b2ad354ce","resolution":{"observed_at":"2026-08-15T14:54:52.959898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T14:54:52.963551Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.963551Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:a572725fc84edf5194c401383d741b7b0d5513f5eb8bd92dd5766a5667ab6ddd","observation_id":"22eb8403-d854-4463-95c4-ea3e3e228bac","resolution":{"observed_at":"2026-08-15T14:54:52.963551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:52.967334Z","title":"Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.967334Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:0c1aab364079a7c44da9e2a2966a08b96400f022ef351074fc7077ec126803fa","observation_id":"e15a25f7-5d7c-4e94-969c-221164ee947f","resolution":{"observed_at":"2026-08-15T14:54:52.967334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T14:54:52.970602Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.970602Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:da71e9843df409b89257db8390d057bd8e535d8aa7b344bc2719b717a118afbb","observation_id":"dc40a1a4-1179-4ad7-a951-9077cd13a1ac","resolution":{"observed_at":"2026-08-15T14:54:52.970602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-15T14:54:52.974103Z","title":"arXiv preprint arXiv:1712.00409 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.974103Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:3af7980af3f30d46f48a320600be4be342ba74218f6df8c9a9bc87a57a9e189c","observation_id":"1261dea4-a1ef-4ec4-a5d3-77413e3379a1","resolution":{"observed_at":"2026-08-15T14:54:52.974103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T14:54:52.978034Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.978034Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:0d4c2898ed8b9d8106a420edbd65a864b9e61cf8df58fae684a9fc18a223d99c","observation_id":"fda5b109-84f8-41fb-ab85-fd56b6105446","resolution":{"observed_at":"2026-08-15T14:54:52.978034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-15T14:54:52.982080Z","title":"arXiv preprint arXiv:2203.15556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.982080Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:1abfaa74306f3b2d6e0dc5528a9abb2da266b86e2a0a4c32d98eb7ceac219ab3","observation_id":"86b49540-92cb-4bb8-8f87-6361e045fad3","resolution":{"observed_at":"2026-08-15T14:54:52.982080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:52.986024Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.986024Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:48c44672a5c7fbcbe766fa7a4e7dc30027805b30a6e5f34b0654ae6b7a0e91cf","observation_id":"2efdf051-7fe8-40eb-9fe2-d19777b7cf01","resolution":{"observed_at":"2026-08-15T14:54:52.986024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:52.989733Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.989733Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:1583b26b95ee07e448d8f81aa25f88ccf445b9f1f3799292f13a100274db46c3","observation_id":"9cf074b6-ca93-445b-8e7b-e58043980931","resolution":{"observed_at":"2026-08-15T14:54:52.989733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-12T00:32:59.085694Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-15T14:54:52.993025Z","title":"arXiv preprint arXiv:2501.12370 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.993025Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:b41ceeaf33f26199ffbd6b7455bb3f316aea882a8b9d398f8523b8deeba090a6","observation_id":"6084a2e6-0e5a-4548-bbba-024d20f45e6c","resolution":{"observed_at":"2026-08-15T14:54:52.993025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05172","last_updated":"2025-02-19T14:36:33Z","snapshot_observed_at":"2026-08-15T00:08:33.325940Z","submitted_at":"2025-02-07T18:55:38Z","title":"Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05172","snapshot_observed_at":"2026-08-15T14:54:52.996839Z","title":"arXiv preprint arXiv:2502.05172 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:52.996839Z"},"links":{"cited_paper":"/paper/2502.05172","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:e605ec03b8a55e9dfb70773f94ab6ba8959bc141f018f7700737e43af1ed8dd5","observation_id":"bf369686-e9cc-4ac7-a6b0-1c2076095e8e","resolution":{"observed_at":"2026-08-15T14:54:52.996839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-08-12T21:28:11.402348Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-15T14:54:53.000585Z","title":"arXiv preprint arXiv:2503.04715 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.000585Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:3c417385fcff96e0e680d2c938c799454fa4761199451c8c1d123119164c4a73","observation_id":"2c8905de-c029-4220-9843-7be93689f9a0","resolution":{"observed_at":"2026-08-15T14:54:53.000585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.004168Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.004168Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:634751615d3fa1be36ed8a69f379c9082ca5b7b50f7e7c629af452c77899bdc1","observation_id":"be4cefbc-1fec-42f4-97d1-62342163d75a","resolution":{"observed_at":"2026-08-15T14:54:53.004168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.007719Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.007719Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:b352e426bb2cf019f559e4c1ef7c2c96caaf4a0276a2218178a27420dce0123d","observation_id":"3ba852a8-d13b-4cc7-882b-6c663d6732e0","resolution":{"observed_at":"2026-08-15T14:54:53.007719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.011294Z","title":"OpenAI blog , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.011294Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:f9fdbd2f2ebc3a2a88745b68e43ad11c798007ea6d88394e15974d753d72c2af","observation_id":"abe33383-4864-442b-938f-6f8911245f92","resolution":{"observed_at":"2026-08-15T14:54:53.011294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.015095Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.015095Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:322d0068fdd26d4c4564828e052d8e7ec5ebc353d2e6c8618796365d36368810","observation_id":"fc90df4e-66ed-479a-b946-09a2ff8ce8e2","resolution":{"observed_at":"2026-08-15T14:54:53.015095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.018393Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.018393Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:dae8baa7ae5953de479f3f7bca443bdac3c38a5cfe57976f671add156d56c113","observation_id":"d6e0ba70-a55b-4ca5-ab0c-c4ed9095b594","resolution":{"observed_at":"2026-08-15T14:54:53.018393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.021652Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.021652Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:276dae1b5c03848e5400c3725c00944b89a150674e87f9b36b557e95e9631005","observation_id":"bbc2df56-26f8-47c8-a697-d0c3d954d205","resolution":{"observed_at":"2026-08-15T14:54:53.021652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.025027Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.025027Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:977aaf0e83bdc3f25690af18b521b7dc442effad1a9e49adddbd5a8c41a7001c","observation_id":"b7b2eef6-8930-4cff-a021-6e94b1bfb31b","resolution":{"observed_at":"2026-08-15T14:54:53.025027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.028466Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.028466Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:7bf755cb75735c06170fa5c299552be07aa387049dcb42cca3b2671469cce4fb","observation_id":"94dde3b9-4d63-44c1-bbe4-9d8e1819f529","resolution":{"observed_at":"2026-08-15T14:54:53.028466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.225196Z","title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":"4c5aed7b-95c5-4622-979b-6795b8e1d2b3","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.032576Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:111acf5522a50b4a66bc13efa163f1f5fa72ddfaff287b3de7d9119f55b85e64","observation_id":"64391c34-2502-4223-8574-6c02c1046dbb","resolution":{"observed_at":"2026-08-15T14:54:54.228695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-15T19:29:26.586064Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-15T14:54:53.036796Z","title":"arXiv preprint arXiv:2208.04202 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.036796Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:a04156e1302d6bb2971136d29bcee6634358cd810e6197812b68a478deafa6e6","observation_id":"b5df5b26-3242-4dc1-b488-b105e9f40b5a","resolution":{"observed_at":"2026-08-15T14:54:53.036796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15766","last_updated":"2024-06-02T13:55:21Z","snapshot_observed_at":"2026-08-13T00:23:10.148298Z","submitted_at":"2024-04-24T09:39:06Z","title":"Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15766","snapshot_observed_at":"2026-08-15T14:54:53.040691Z","title":"arXiv preprint arXiv:2404.15766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.040691Z"},"links":{"cited_paper":"/paper/2404.15766","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:913cf1811d1cd7fff89ccd86c4fa573d6e2aa98dc9807a80027e98f46708d338","observation_id":"9ea58332-30cb-4e3a-bf35-893d7d6cdbcd","resolution":{"observed_at":"2026-08-15T14:54:53.040691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-08-14T20:57:18.809821Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-15T14:54:53.044551Z","title":"arXiv preprint arXiv:2310.16834 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.044551Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:8ca44ab0aa97424e8012a8cb29169b2bfaa327b82477abefec383fac64a01a5a","observation_id":"64a39fda-29e4-44dd-9656-95222abf72b7","resolution":{"observed_at":"2026-08-15T14:54:53.044551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.048318Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.048318Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:362fe8f3d5bfb9e7f74bb84003d1a100589685c175d1448d2c449335936cc273","observation_id":"e47d7054-432e-4b94-82dd-ff89b5a2b5f5","resolution":{"observed_at":"2026-08-15T14:54:53.048318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.051918Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.051918Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d3d0dfb7c779858651a5f6356ebb5110082239effe520c00c017c224fe3d1b47","observation_id":"2d85350a-7c88-4fa0-a872-c05b11f94d12","resolution":{"observed_at":"2026-08-15T14:54:53.051918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.201990Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"42635d44-3d4f-4b84-a67a-6f8a54dc0103","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.055822Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:17ba4281e1e1e8ed48aecd818e6d5268ae656270c8c5770dfc00db351ad6e5e6","observation_id":"5df4ee44-4a60-43a5-8a27-60fbae1cd7ca","resolution":{"observed_at":"2026-08-15T14:54:54.205519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.191093Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"1645b595-5481-4d3c-853c-f24df78f4c36","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.059491Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:9c1903c6b13783fdd37a24115659fc5672533c5baa19b418efe82965b24fb3e2","observation_id":"6ec388bc-2f80-4282-a437-77eebb97e1f5","resolution":{"observed_at":"2026-08-15T14:54:54.194608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.063186Z","title":"arXiv preprint arXiv:2510.03280 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.063186Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:02a04e46f733f8e8c8908a7462fa5c0146d525c5d43fe941270bf31cfe778f13","observation_id":"991f974d-388a-4041-ab5d-0d47ee751760","resolution":{"observed_at":"2026-08-15T14:54:53.063186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.180218Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"fe305030-c39d-4b55-95d4-b2e35abadd7d","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.066854Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:46f9252abf195702e451392261e3be72e25553e16d884b3024a6a8c38a4fe109","observation_id":"ebd66ced-8da8-4cbb-882f-4d0d663ccc9a","resolution":{"observed_at":"2026-08-15T14:54:54.184057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.070324Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.070324Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:5aa9f608d8b5a6f95f88958d924b174c4f4937c3fbaac9aaafcf753522e5c928","observation_id":"caef4893-8236-4384-a843-1601999a7d3a","resolution":{"observed_at":"2026-08-15T14:54:53.070324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.073982Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.073982Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d255c30515afbe80c110cc9e5f86b65524a688b171f9313329f58a3cb4683720","observation_id":"b495b72f-0cbf-40d9-9922-322c895a6699","resolution":{"observed_at":"2026-08-15T14:54:53.073982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.077088Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.077088Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:0691ced00b526d0508ed8cb3f4d567b56261212b652fbf3b20312a9206c3bb52","observation_id":"b928897f-33da-4b3a-b410-5b6577d4c080","resolution":{"observed_at":"2026-08-15T14:54:53.077088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25331","last_updated":"2026-06-24T02:51:36Z","snapshot_observed_at":"2026-08-14T14:03:12.603128Z","submitted_at":"2026-06-24T02:51:36Z","title":"Improved Large Language Diffusion Models","version":1},"cited_work":{"arxiv_id":"2606.25331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.25331","snapshot_observed_at":"2026-08-15T14:54:53.710587Z","title":"Improved Large Language Diffusion Models","venue":"cs.CL","work_id":"a9d010eb-2ac7-4a64-b715-54a50279e3d8","year":2026},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.080402Z"},"links":{"cited_paper":"/paper/2606.25331","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:89190713b38f1d4d1c127452deb5ea79c3eff7e9767bd4b689f9f3e55e685c98","observation_id":"8b4bf501-ab9c-4a01-b38e-4509805f46e5","resolution":{"observed_at":"2026-08-15T14:54:53.715349Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.150205Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"bafa8eda-40aa-4fb9-b87d-f585f78bdd18","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.083853Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d79df589915c96e4accd2d3daadfb9c1cfdb08e63ba7d103762405fe9a73a236","observation_id":"e7b3a87d-d071-44f8-9d64-2122bdf209ca","resolution":{"observed_at":"2026-08-15T14:54:54.153984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.087165Z","title":"Dream 7B , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.087165Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:833e7fe547c988c2c1c1ea1f4492af55ced59945aabb060f85704feb1f33b38c","observation_id":"d5cb847b-dddf-4ede-9f40-ccb5db8a54e1","resolution":{"observed_at":"2026-08-15T14:54:53.087165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.090534Z","title":"arXiv preprint arXiv:2509.24389 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.090534Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:5b44a49ac6fca50b9b8abab5be5e21a69d0232a546d2b6305125790aaa8c27bd","observation_id":"6026ebe9-b289-448e-8c25-3cc802fd7b5a","resolution":{"observed_at":"2026-08-15T14:54:53.090534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-08-13T09:36:05.994763Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-15T14:54:53.094173Z","title":"arXiv preprint arXiv:2508.02193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.094173Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:24c4e5f699edbcc50b58997b5e660a6456d2c6763ee3145ecb7a61d034bbc53a","observation_id":"e36e7b3b-9ea2-4c3b-9408-063d72d38c08","resolution":{"observed_at":"2026-08-15T14:54:53.094173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-08-16T00:24:16.429058Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-15T14:54:53.097941Z","title":"arXiv preprint arXiv:2506.17298 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.097941Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:a3025aa9735262aed2f906e61f6b74162f4ed90d46171e16ed6766a1fdafcf10","observation_id":"47124b80-aab9-46b0-8857-a98b7dbd21d8","resolution":{"observed_at":"2026-08-15T14:54:53.097941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-16T07:41:14.131768Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10875","snapshot_observed_at":"2026-08-15T14:54:53.102557Z","title":"arXiv preprint arXiv:2508.10875 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.102557Z"},"links":{"cited_paper":"/paper/2508.10875","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d259e52e5ba92d63a6835da290a058cdbed8132750e551b8cf477046fc0662e7","observation_id":"ec5f3e20-305d-4036-9425-4c39d8f7f448","resolution":{"observed_at":"2026-08-15T14:54:53.102557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.106073Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.106073Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:4ef587cfcfab9e996ac002385ea4c72507cea9d935dd17f6702cb814a844160e","observation_id":"128f563b-0b1a-45cb-870f-a31c81a7745f","resolution":{"observed_at":"2026-08-15T14:54:53.106073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.125702Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"e4d91c25-663b-4ee2-b023-7fd833e2b692","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.109809Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:ff6609775b6ec296b08cf9d26ef6dbc045505bd175fc0d3de497a30a083ae625","observation_id":"7947933a-bb29-4922-ac17-10bac9834349","resolution":{"observed_at":"2026-08-15T14:54:54.129423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.114620Z","title":"arXiv e-prints , pages=","venue":null,"work_id":"952dc149-f469-4c5d-b8a5-ac15e47682de","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.113077Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:ee0e62d20e87144ccbca8ca943577dbc945ff6c43f98c15b466d20384deef176","observation_id":"50b3f40e-14c6-4748-9c2e-618650574541","resolution":{"observed_at":"2026-08-15T14:54:54.118248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.103839Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"84a21010-c191-4de8-bc10-87dc240f5973","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.116586Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:447588b62d2d13cb959e3b62e7c8994fbbcfb662b312f53a5870519ae53cebef","observation_id":"bea49905-124e-454d-b4e4-13d014752b44","resolution":{"observed_at":"2026-08-15T14:54:54.107425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.119929Z","title":"arXiv preprint arXiv:2602.15014 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.119929Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:93a1e0cc1f3b7bef62406d749117fe0b0072ba9059ca7eeed857dd52a511db65","observation_id":"97df7726-25bc-4991-8e62-b9f26c9b7749","resolution":{"observed_at":"2026-08-15T14:54:53.119929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-15T14:54:53.123132Z","title":"0: Scaling up diffusion language models to 100b , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.123132Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:0906cd2b905b2b47d43a5864b59394495ef499288058272aa078d6f3deea3492","observation_id":"126e29bf-78bd-4fc2-a8a1-55a52d91e9e3","resolution":{"observed_at":"2026-08-15T14:54:53.123132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.126756Z","title":"arXiv preprint arXiv:2511.03276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.126756Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:ed2fe03561fa19f7859578dd196e7c2b16cd0dcbaa812df7506bca3dba3be6f5","observation_id":"d857c1f6-a465-4610-ab3f-14ece18875ea","resolution":{"observed_at":"2026-08-15T14:54:53.126756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.093119Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"fdd89619-d6da-417e-b988-01dd3349b824","year":2026},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.130377Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:152b202877f50dff55abaeb92c14e4a5ddb1bdfb92357d653a202689bdceca43","observation_id":"8b974f91-7218-4993-86a9-99f6a18de55e","resolution":{"observed_at":"2026-08-15T14:54:54.096808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"cited_work":{"arxiv_id":"2605.30876","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30876","snapshot_observed_at":"2026-08-15T14:54:53.458485Z","title":"dMoE: dLLMs with Learnable Block Experts","venue":"cs.CL","work_id":"57f8ebd3-5e5c-43bb-aa45-475ff7df37ea","year":2026},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.134040Z"},"links":{"cited_paper":"/paper/2605.30876","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:f71413e5f127aa7103321bcc41c8029987d966b9671838634bed0accfb6f6e75","observation_id":"04a14416-6abf-4296-a821-17e29a4701d6","resolution":{"observed_at":"2026-08-15T14:54:53.464595Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01622","last_updated":"2026-08-03T16:07:55Z","snapshot_observed_at":"2026-08-15T16:04:26.460825Z","submitted_at":"2026-04-02T05:01:36Z","title":"Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.01622","snapshot_observed_at":"2026-08-15T14:54:53.137569Z","title":"arXiv preprint arXiv:2604.01622 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.137569Z"},"links":{"cited_paper":"/paper/2604.01622","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:22fa9bd899f5d0387a7f6cea96ce2a5cc47d883af7f55767d18178f61c7b6779","observation_id":"b202179c-5108-443f-b91e-3c66846ee8b3","resolution":{"observed_at":"2026-08-15T14:54:53.137569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06036","last_updated":"2026-05-28T09:13:25Z","snapshot_observed_at":"2026-08-14T23:40:22.559473Z","submitted_at":"2026-02-05T18:59:30Z","title":"DFlash: Block Diffusion for Flash Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06036","snapshot_observed_at":"2026-08-15T14:54:53.141263Z","title":"arXiv preprint arXiv:2602.06036 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.141263Z"},"links":{"cited_paper":"/paper/2602.06036","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:68c24c929bbaa3669dd89cfe97dcedba967d19ec485353e9b96e27c50d107b57","observation_id":"bf0ce0b0-b63b-4f20-b9b8-f61bc24469a3","resolution":{"observed_at":"2026-08-15T14:54:53.141263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05147","last_updated":"2026-07-06T14:28:06Z","snapshot_observed_at":"2026-08-11T08:41:15.340879Z","submitted_at":"2026-07-06T14:28:06Z","title":"DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05147","snapshot_observed_at":"2026-08-15T14:54:53.144855Z","title":"arXiv preprint arXiv:2607.05147 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.144855Z"},"links":{"cited_paper":"/paper/2607.05147","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:7b4f5944a3c499de026934527b7708bd705a5cb345ff8781c034809bac70cf98","observation_id":"5ad64725-31d1-4a65-bc11-652075915d36","resolution":{"observed_at":"2026-08-15T14:54:53.144855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.148461Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.148461Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:c68ae929f1e3ecca012051025ff4ee34d78275212274317247cb347fe897b61d","observation_id":"ea22e41c-ea76-4029-961d-782f7116a91f","resolution":{"observed_at":"2026-08-15T14:54:53.148461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T14:54:53.151806Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.151806Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:15ebc1838af1e977f0d135423b6d7e5e2528a0d0f6ecafde4e5051c84ba50046","observation_id":"51d4c490-9b38-4c25-a012-5833966ad492","resolution":{"observed_at":"2026-08-15T14:54:53.151806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-15T14:54:53.155681Z","title":"arXiv preprint arXiv:2002.05202 , year=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.155681Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:ae2b9da899f77b6789c12b824268fc3a9afd07b29e36318d7106e82555508165","observation_id":"845867cb-d805-4ba5-b183-fb495e42741e","resolution":{"observed_at":"2026-08-15T14:54:53.155681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.076298Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":"05889718-5350-436e-822d-1446c27864b2","year":2023},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.159783Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:35cc603ccb820c099d369c03c039da43c84cdbd0dfab2ce9320704240d38e578","observation_id":"ca6b9a35-6527-4bcc-b4cc-22d3c76976e7","resolution":{"observed_at":"2026-08-15T14:54:54.079835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.163109Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.163109Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d966cb810a63c51b0f301884281c7b5b4fea75cdd25e0413c6ddb2301db9d2b0","observation_id":"83023f4b-91b7-4c9e-95ac-0af83c8640be","resolution":{"observed_at":"2026-08-15T14:54:53.163109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.059155Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) , pages=","venue":null,"work_id":"8fed988a-9da3-4c60-a194-6a10059de2be","year":2024},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.166414Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:11210b95893fa68ff7a5769f30c3debad7a13eef79e29c95c5a1047fea265013","observation_id":"95ee070a-6525-461d-8916-4814d13eb6f8","resolution":{"observed_at":"2026-08-15T14:54:54.062887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.047777Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"0794b3a1-a5ea-4821-a9ce-f7fa565cf29a","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.169811Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:f23051958fa206a533b613883a01266becfcdfacef483307a4094a58278e2144","observation_id":"02e049a8-2cec-46aa-ab57-c6bb771b34fa","resolution":{"observed_at":"2026-08-15T14:54:54.051623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-13T04:20:21.968880Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-15T14:54:53.172947Z","title":"arXiv preprint arXiv:2402.07871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.172947Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:88220c3c20cc93a42b7d1f8201202727f7aeaf0e57e5989a18ffdd63c1f61451","observation_id":"1bc886c4-2d67-4239-9e0a-ad01dd08c488","resolution":{"observed_at":"2026-08-15T14:54:53.172947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T14:54:53.176291Z","title":"arXiv preprint arXiv:2401.04088 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.176291Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:7074c7fa0095c99d5e7772f7ea212acc140f974b8ff875b11598cd879279def8","observation_id":"22173e29-ed15-4a68-86f5-71243fd2025f","resolution":{"observed_at":"2026-08-15T14:54:53.176291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T14:54:53.179929Z","title":"arXiv preprint arXiv:1701.06538 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.179929Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:458195b20a1a7b3505eb00bbbb6d84fbb62eaa44a4c2fc1d2e70312c531259de","observation_id":"d685a404-6ba5-4865-ad6a-a285e8e854f5","resolution":{"observed_at":"2026-08-15T14:54:53.179929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-15T14:54:53.183723Z","title":"arXiv preprint arXiv:2006.16668 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.183723Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:b91ea6f347ea29fbba5e971f2e9e328d1892238548d849d87120feaf1a44ac4c","observation_id":"eae97c02-4547-4bfa-835f-624bdc6a14a2","resolution":{"observed_at":"2026-08-15T14:54:53.183723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.187768Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.187768Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:e02798baa9edf377c0dad20541500b4913c2b3bdd0f9433bda708eff91fb35d9","observation_id":"c13e2aa1-c830-4d9c-a9e9-2e35a3a3dd22","resolution":{"observed_at":"2026-08-15T14:54:53.187768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.191060Z","title":"Neural computation , volume=","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.191060Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:fdf289d0cc377cd614011c8472e3c3e524a5fe353fa8deff670238d9cbb1f0d3","observation_id":"604ca863-9c4e-4f37-97f2-8fcb9b3ec316","resolution":{"observed_at":"2026-08-15T14:54:53.191060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-15T14:54:53.194432Z","title":"arXiv preprint arXiv:2202.08906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.194432Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d7fe28f7a8a0f5ac14df5a64b8e9f361ba377f77e336ee817d4e46d44a07618e","observation_id":"947ee811-a441-43d6-8425-c789a6daaf12","resolution":{"observed_at":"2026-08-15T14:54:53.194432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-15T14:54:53.197951Z","title":"arXiv preprint arXiv:2502.16982 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.197951Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:80ea0ed675fd38118a72b427f414411cdc05b7d1a47c0cec4a139c9ad6707c73","observation_id":"fa441e14-d273-402f-bbd2-6bf854e1bf70","resolution":{"observed_at":"2026-08-15T14:54:53.197951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.201763Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.201763Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:c3f3fbe719bc62ef1e3b2bdbe0ecef2a6dad85ce9b0ca20e75febd9a0e866b37","observation_id":"a5a3322d-bf8b-4b3f-9a36-1a3258859e74","resolution":{"observed_at":"2026-08-15T14:54:53.201763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T14:54:53.205217Z","title":"arXiv preprint arXiv:2009.03300 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.205217Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:afbe846ddefff563feb3e22d6dbf70a1d9aa28c5045b0d603aaa7d3888c19bd1","observation_id":"95d0a104-3ced-46eb-a038-32bfc6212eaf","resolution":{"observed_at":"2026-08-15T14:54:53.205217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.208822Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.208822Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:84ec4e9c6140fe32f8260c1530aa95687ded0e3513a757893961abf21807f386","observation_id":"2422a981-6b46-49d5-b684-b18badab8041","resolution":{"observed_at":"2026-08-15T14:54:53.208822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:54.011257Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"9391fc17-a3a8-46c5-9ea1-f7bb8f7ac938","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.211938Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:f2d17504a17e7835ecaa7746350d77aa4d66a8ea15f1f50d32ee73b89a7edaec","observation_id":"bc595300-3fab-4f3c-ad36-40fc9555a072","resolution":{"observed_at":"2026-08-15T14:54:54.014803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.999758Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":"6421b9d0-cb72-48b6-adc2-1fffa1af2451","year":2024},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.216328Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:44d80cbee5e27cb8d3113f657b56888c650eaaa6789ffd1ccc8060f2c218c712","observation_id":"0bc3ffe4-4c02-428f-951e-5f4f451b8726","resolution":{"observed_at":"2026-08-15T14:54:54.003972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.219903Z","title":"Proceedings of the 57th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.219903Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:5f77bec456c55a3c371dfdf762313a8908926abd7f47b4618264e861037934fe","observation_id":"b3c605a8-5ef1-4cc7-a74b-24060c9b396e","resolution":{"observed_at":"2026-08-15T14:54:53.219903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.982927Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"8c30dc02-71a0-4c74-a85f-5c6c84a82ee5","year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.223215Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:819daf26ce3fc7583f51ee3da2a30aeeb560bddce1cc6598ca970fb9bed73040","observation_id":"4d43f2dc-96b1-485a-80b2-636aafdc4cb3","resolution":{"observed_at":"2026-08-15T14:54:53.986631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T14:54:53.226271Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.226271Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:d4539bad106d96c187d393f060afe4287a8fe1cbb66c63954887070585de6d44","observation_id":"1d8e1eb1-a840-4bc0-9732-e8513ee7ae0c","resolution":{"observed_at":"2026-08-15T14:54:53.226271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T14:54:53.229762Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.229762Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:b36a9b7e28d8f60d79617dd35f636f03519de8cb857a2f6102df4e066e00937c","observation_id":"bd29b304-ae32-42cc-b23f-6dc2f5032224","resolution":{"observed_at":"2026-08-15T14:54:53.229762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.233320Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.233320Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:e4a77eec529a911963ea87f579c60efec5aa7ed5fee94e9256856f3091f1af7c","observation_id":"a96fb5dc-0f73-45d4-8c81-af9c6890ee5f","resolution":{"observed_at":"2026-08-15T14:54:53.233320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-08-13T22:46:36.295191Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-15T14:54:53.236855Z","title":"arXiv preprint arXiv:2401.03065 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.236855Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:f900f46a6bab3604e27cf7612c4bbef2db6517f152d8d767779ebbfbb76dc8c4","observation_id":"bed8744b-f7a2-4afe-bb78-b81373ef9f4c","resolution":{"observed_at":"2026-08-15T14:54:53.236855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T14:54:53.240344Z","title":"arXiv preprint arXiv:2108.07732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.240344Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:a99dc502b4e665bc3b1c3acee1b738bf12659a5ee2cf1eabff66fafbaa0b865b","observation_id":"4ae4e16c-ad30-4a66-af79-3e4389f958de","resolution":{"observed_at":"2026-08-15T14:54:53.240344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-15T14:54:53.244102Z","title":"arXiv preprint arXiv:2208.08227 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.244102Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:db3bedfa996fb0d0ae508a95e42cd331d0ea6746c830324ec1fbad97b99035e5","observation_id":"878ca4bd-0806-4965-b514-8313bea22b41","resolution":{"observed_at":"2026-08-15T14:54:53.244102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T14:54:53.247943Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.247943Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:e687cff72232519f8b1d8516b85c3ef58abe1d6bd1e5c12828a25ef8c25b1c9d","observation_id":"e3938718-344f-4cad-977e-a9f1ba294cc7","resolution":{"observed_at":"2026-08-15T14:54:53.247943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.251157Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.251157Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:2a69a36a52ed673fae3cb71e1950f9815b6a113b820f3607e30d8ca0c02c1da4","observation_id":"323cffd1-091f-470a-9e22-088ea29f9bd3","resolution":{"observed_at":"2026-08-15T14:54:53.251157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:53.254253Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:54:53.254253Z"},"links":{"citing_paper":"/paper/2608.03457"},"observation_digest":"sha256:472534d4b02bc6f1c9ffbaa49dab9d80e07253499b4e62a7ea2998430ffba68f","observation_id":"1e354280-3689-4878-b3df-4cfb7fe5d97d","resolution":{"observed_at":"2026-08-15T14:54:53.254253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03457","last_updated":"2026-08-04T10:53:02Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T08:13:59.590707Z","submitted_at":"2026-08-04T10:53:02Z","title":"LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2608.03457."}