{"as_of":"2026-08-05T13:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a85b275fb8f007f7051e29c2b486b048e59c5435f7a1e3a2e5b47910fc0743f","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:50:51.900169Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30876/citation-record","integrity":"/paper/2605.30876/integrity","json":"/paper/2605.30876/citation-record.json","paper":"/paper/2605.30876"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Diffusion models in text generation: a survey.PeerJ Computer Science, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:84568409a85a592de37c7f1b7334aba69a04dad4a90acdca6dde72840f0a360f","observation_id":"60f09b77-d54f-4be0-8a60-6ee85e971b39","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08712","doi":"10.48550/arxiv.2508.08712","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on parallel text generation: From parallel decoding to diffusion language models","venue":"ArXiv.org","work_id":"5ed8cd4c-2414-4824-bac0-afafbb7ca3ec","year":2022},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:4010926e890f98d5232872f4112025a3c8faed7a16e4655ae0ff6eb4b07f6ba2","observation_id":"c4a03d13-6c9f-453b-8ba4-f020cad61b1f","resolution":{"observed_at":"2026-06-28T22:52:45.079405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:1b9069bb184fdb11cc11189a869ca4089614d377d10e0078bbc2e0cef440ab4f","observation_id":"bcf93b68-da33-4821-9777-0728f4568e90","resolution":{"observed_at":"2026-06-28T22:52:45.069274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.15487","doi":"10.48550/arxiv.2508.15487","metadata_source":"pith","pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream 7B: Diffusion Large Language Models","venue":"cs.CL","work_id":"a8a49dbd-ad10-4c79-b1aa-3ad5173887ad","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:170588ced6de963c5767f49d8b47691629189763f71e672e5a5fa384ef3810d6","observation_id":"5cf7b828-1bb3-49fe-949e-d8f46fe8e926","resolution":{"observed_at":"2026-06-28T22:52:45.081707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16990","last_updated":"2025-05-26T02:04:39Z","snapshot_observed_at":"2026-08-04T14:44:24.484837Z","submitted_at":"2025-05-22T17:55:04Z","title":"Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding","version":2},"cited_work":{"arxiv_id":"2505.16990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16990","snapshot_observed_at":"2026-07-11T03:07:51.665307Z","title":"Dimple: Discrete diffusion multimodal large language model with parallel decoding.arXiv preprint arXiv:2505.16990","venue":"cs.CV","work_id":"6d9ab858-5467-437a-80dc-c4ee9dac2f26","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.16990","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:359662596f3a6d7949dcb2786686be68acd10468f12990fe719b90632c761a45","observation_id":"f7c3f169-2953-4843-ba67-82a0b1772112","resolution":{"observed_at":"2026-06-28T22:52:45.109759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:cdc5a7821f75d5c4e8b712ec2ba6ce3b27a4ce8f85214629596fa90815ba1a45","observation_id":"60435e1b-0fe0-4958-be65-d740bbf2d1bd","resolution":{"observed_at":"2026-06-28T22:52:45.151112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:c6ce236e78d1b9d318fa497cf29f27b4be6fa40a9a1a2c911553400bb1e868a3","observation_id":"acdf9394-4b2e-4820-8d19-7412646d89e2","resolution":{"observed_at":"2026-06-28T22:52:45.093401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:efd1591109bed9b1a8d469de2f656f02aaefbfed7bdacc9268da675457c71dbe","observation_id":"4f863aa9-7ea0-4a25-8c70-a26fd50d142c","resolution":{"observed_at":"2026-06-28T22:52:45.081901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-07-06T22:07:21.387432Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":"2508.02193","doi":"10.48550/arxiv.2508.02193","metadata_source":"pith","pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","venue":"cs.CL","work_id":"7412f5f3-8e71-41c1-9c69-d4ca250b18fa","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:90038cb0afd57081e3efb0b816fe0902edcb21e00cbe226d799eff75d95c8381","observation_id":"d7b4951c-36ba-4853-8e55-1f641baf9f1d","resolution":{"observed_at":"2026-06-28T22:52:45.092678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":"2506.17298","doi":"10.48550/arxiv.2506.17298","metadata_source":"pith","pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","venue":"cs.CL","work_id":"09638e55-9958-4407-94da-0a6fbc082ebc","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:161d59c3ef2b055b00873edb8e87631d940f313787c5ea114692d88f1c3c3458","observation_id":"86e27ef6-ced1-4a3a-8f79-2f7660d6b884","resolution":{"observed_at":"2026-06-28T22:52:45.084117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:5bca6a7a77cd15b9a2830927ef429f0abb0636c0aa426db7278f4e0165fd117b","observation_id":"b0b19b3c-6c06-4cd6-8eb0-5236d28d8b7c","resolution":{"observed_at":"2026-06-28T22:52:45.017324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Llada2.1: Speeding up text diffusion via token editing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:6920b9dc69545734b033b648f83cc9fa6b615d6bc41c54d9bd2ce25e8f089e30","observation_id":"4d62f37f-6d9e-4b6f-ace9-7b0781aabd46","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:19:56.339230Z","title":"Llada-moe: A sparse moe diffusion language model.arXiv preprint arXiv:2509.24389","venue":null,"work_id":"feff7b05-9bcc-4d32-9d00-27d330f91e79","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:39405aa7f5b9b4a691a715ff2e1dd785955deacaf5253ffee84f9082535f8001","observation_id":"6774d0a5-b5ed-4618-9e8c-1038dfbf9742","resolution":{"observed_at":"2026-06-28T22:52:45.028861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:51.378138Z","title":"Sdar: A syn- ergistic diffusion-autoregression paradigm for scalable sequence generation.arXiv preprint arXiv:2510.06303","venue":null,"work_id":"78561109-9df2-4b95-b2c6-4136d3384b98","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:52e4478f04c2d41b25d8733f7a2fb5ea21699c3169424f7afd5396113c65b3cf","observation_id":"7bbc8153-2034-48ab-97b3-5a6905d1ee98","resolution":{"observed_at":"2026-06-28T22:52:45.125308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Openmoe 2: Sparse diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:772257aaf070edaa8486eabd2c277e283cb7324769e9a853ec1849eaba654d48","observation_id":"766b9bdb-34d6-4120-81cb-26839bba6125","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:7be5b492b9111475394e35808bd1ecfc29a560f0f7ca4bf64d6292b7fc383447","observation_id":"89eaa1b7-1d7e-450c-8ede-800de14161d0","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00945","last_updated":"2024-07-01T03:57:35Z","snapshot_observed_at":"2026-07-06T18:39:20.664293Z","submitted_at":"2024-07-01T03:57:35Z","title":"Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs","version":1},"cited_work":{"arxiv_id":"2407.00945","doi":"10.48550/arxiv.2407.00945","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient expert pruning for sparse mixture-of-experts language models: Enhancing performance and reducing inference costs.arXiv preprint arXiv:2407.00945","venue":"arXiv (Cornell University)","work_id":"4074edce-f38a-42f4-b6e6-a579aeba7788","year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2407.00945","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:7bc31b700e8ac34c9b9386447f95448bd0145e25e2e8ce71e2dc77b7109da218","observation_id":"e62a1f1a-b2f7-4f84-b6dc-bdce1d046c27","resolution":{"observed_at":"2026-06-28T22:52:45.115735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00277","last_updated":"2022-06-02T03:44:04Z","snapshot_observed_at":"2026-07-06T13:16:13.214340Z","submitted_at":"2022-06-01T07:09:01Z","title":"Task-Specific Expert Pruning for Sparse Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2206.00277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.00277","snapshot_observed_at":"2026-07-03T21:18:58.223513Z","title":"org/CorpusID:235755472","venue":null,"work_id":"e2366bed-1890-4253-b528-88fa5507128e","year":2022},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2206.00277","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:4ee2dcba12c0eee5e08e2bb71547a27b50cc3beebcda63947b43afbffa448071","observation_id":"750724b4-e72b-4f90-a591-17ccc1ec5577","resolution":{"observed_at":"2026-06-28T22:52:45.118672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16646","last_updated":"2024-05-30T17:30:42Z","snapshot_observed_at":"2026-07-06T18:20:09.790181Z","submitted_at":"2024-05-26T17:52:58Z","title":"A Provably Effective Method for Pruning Experts in Fine-tuned Sparse Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2405.16646","doi":"10.48550/arxiv.2405.16646","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16646","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A provably effective method for pruning experts in fine-tuned sparse mixture-of-experts","venue":"arXiv (Cornell University)","work_id":"8c2d7f57-d977-4980-9ab0-3b58dcc23a41","year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2405.16646","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:897ab038d13f9f9dbd20f929d13d57ea11a8c68a5372df4114721c2f36676292","observation_id":"3bc4c394-8b2b-4471-9367-b887d33043e3","resolution":{"observed_at":"2026-06-28T22:52:45.130360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07807","last_updated":"2025-04-10T14:46:26Z","snapshot_observed_at":"2026-08-02T00:53:11.414308Z","submitted_at":"2025-04-10T14:46:26Z","title":"Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.07807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07807","snapshot_observed_at":"2026-06-28T22:52:45.142519Z","title":"Cluster-driven expert pruning for mixture-of-experts large language models.arXiv preprint arXiv:2504.07807, 2025","venue":null,"work_id":"ed68585e-532d-458a-85ea-d2d17c9aaa74","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2504.07807","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:772837a8862f737859ca9291afae253ddf448e70c43055c6d1d3c3c58a13e4f1","observation_id":"da3b8b08-ce24-410f-85a2-23461080d5d9","resolution":{"observed_at":"2026-06-28T22:52:45.144776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-07-06T21:55:45.641812Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"cited_work":{"arxiv_id":"2507.08771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08771","snapshot_observed_at":"2026-07-04T15:39:56.501546Z","title":"Blockffn: Towards end-side acceleration-friendly mixture-of-experts with chunk-level activation sparsity.arXiv preprint arXiv:2507.08771, 2025","venue":null,"work_id":"a28beb10-fd4c-400b-b5c5-f9b61c7cef36","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2507.08771","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e3cfe9da797d7c0f041392677a8605c42578925e32acaaa98ea92ec3992cbb70","observation_id":"443bc417-9566-4821-9188-faa0047dcff7","resolution":{"observed_at":"2026-06-28T22:52:45.095922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Merging experts into one: Improving computational efficiency of mixture of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:48570fd5b3c19457db52f8bb4fdaa994efd020c133106a68f59ab002b4a80e97","observation_id":"7c137020-99f5-4736-9db0-97569797b837","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11530","last_updated":"2024-05-19T11:55:48Z","snapshot_observed_at":"2026-08-01T15:38:47.662370Z","submitted_at":"2024-05-19T11:55:48Z","title":"Learning More Generalized Experts by Merging Experts in Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2405.11530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.11530","snapshot_observed_at":"2026-06-28T22:52:45.104982Z","title":"Learning more generalized experts by merging experts in mixture-of-experts.arXiv preprint arXiv:2405.11530, 2024","venue":null,"work_id":"def04aca-a4cc-4c32-8130-5f27738128be","year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2405.11530","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:ac9cf57b169c7362f4964360267a9092ffff40044f6ecd3f2d1076d249bfd0bb","observation_id":"dd9abeb9-e557-41f2-99aa-1b338c9ed586","resolution":{"observed_at":"2026-06-28T22:52:45.107047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Sub-moe: Efficient mixture-of-expert llms compression via subspace expert merging","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:02ede380b3a2029366a24fa7cf9d3c9602ba84a068f9a99b50bc6cd0b0c97a03","observation_id":"f7b65535-c760-47ee-ad3b-cbc694684ff3","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:c8fb7ca742c9f9c4a1cd6f3c88bc8d3842e9a378602a1ad427a83295bb2ba171","observation_id":"a3035e5a-639b-4524-93f7-9df70b713721","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:52:45.101312Z","title":"arXiv preprint arXiv:2511.15690 , year=","venue":null,"work_id":"e0f085f0-29a6-4b92-ab71-14579961d95a","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e2db47adee4ee075acfb72274597d3ba0ccaf9d5822a2a1b9496f6bbeb3cf293","observation_id":"ea4de0d8-6a6c-4243-bb0b-2c8c889a12c6","resolution":{"observed_at":"2026-06-28T22:52:45.103851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06669","last_updated":"2024-09-10T17:36:15Z","snapshot_observed_at":"2026-08-03T23:35:37.065560Z","submitted_at":"2024-09-10T17:36:15Z","title":"DA-MoE: Towards Dynamic Expert Allocation for Mixture-of-Experts Models","version":1},"cited_work":{"arxiv_id":"2409.06669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06669","snapshot_observed_at":"2026-07-01T21:56:15.934324Z","title":"Da-moe: Towards dynamic expert allocation for mixture-of-experts models.arXiv preprint arXiv:2409.06669","venue":null,"work_id":"5fd4b7b5-86f8-48ca-b804-d3a3ae6abd11","year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2409.06669","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:c9b63fd5f1d34fbb0936aa33f357e968534d4bd3d026bb49f03cba7c1e8e2bc4","observation_id":"8d27f3e0-0598-4e9a-9ae4-314ca7c41741","resolution":{"observed_at":"2026-06-28T22:52:45.059089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Eac-moe: Expert-selection aware compressor for mixture-of-experts large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:2c254f6a73c2cdd8abde6361166c6bf915fed5c7d5d3fd0b23aabf1382fed5a3","observation_id":"20c9f837-6813-4417-87fa-7f07eba35551","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:52:45.046250Z","title":"Rexmoe: Reusing experts with minimal overhead in mixture-of-experts","venue":null,"work_id":"9cf56bee-7739-4872-a940-37e3feab60a5","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e5b69f2cbf004f1415cb40f5776a5c2f04d798def73eb5e9a209e4804f95c1a4","observation_id":"002143b6-538c-4951-83f6-16c39a9623de","resolution":{"observed_at":"2026-06-28T22:52:45.047801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.02237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T18:58:50.436012Z","title":"Opportunistic expert activation: Batch-aware expert routing for faster decode without retraining.arXiv preprint arXiv:2511.02237, 2025","venue":null,"work_id":"dbcdfc0e-88ea-4753-8188-e111daf66e19","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e6931640ea3b9becc03b03f2ace172c193b8050cbdb2962b789ee198334b93a9","observation_id":"ed6d3b79-4016-43f3-956b-5de2e1ee12f0","resolution":{"observed_at":"2026-06-28T22:52:45.099977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01622","last_updated":"2026-08-03T16:07:55Z","snapshot_observed_at":"2026-08-05T12:35:05.078622Z","submitted_at":"2026-04-02T05:01:36Z","title":"Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2604.01622","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2604.01622","snapshot_observed_at":"2026-08-04T03:26:42.507894Z","title":"Expert-choice routing enables adaptive computation in diffusion language models.arxiv preprint arXiv:2604.01622, 2026","venue":null,"work_id":"0a7fb561-491e-4ddf-ac5c-65e5dd17fe65","year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2604.01622","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:0018b0a03d983a42bcb93168c83f076899ac01b7561bd07d17d0f6c2403d07ec","observation_id":"589ce929-a2a2-4c58-99f0-c8f71dfcf261","resolution":{"observed_at":"2026-08-04T03:26:42.507894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08404","last_updated":"2026-08-03T02:35:28Z","snapshot_observed_at":"2026-08-05T12:30:17.306807Z","submitted_at":"2026-02-09T09:05:46Z","title":"TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration","version":3},"cited_work":{"arxiv_id":"2602.08404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08404","snapshot_observed_at":"2026-07-04T01:39:23.987540Z","title":"Team: Temporal-spatial consistency guided expert activation for moe diffusion language model acceleration","venue":"cs.CL","work_id":"d732de23-5078-4795-ba07-c69f6ad3ac91","year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2602.08404","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:192ac42412800262c25e58c677f691c5e795ce47aec479781cbaf41634b48c5d","observation_id":"cc2cc0ba-a77c-456e-aa30-5833f9e0169f","resolution":{"observed_at":"2026-06-28T22:52:45.066882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.00879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:52:45.021341Z","title":"Dynamic expert sharing: Decoupling memory from parallelism in mixture-of-experts diffusion llms.arXiv preprint arXiv:2602.00879, 2026","venue":null,"work_id":"7783f8d7-c286-40f6-8593-e8c9e6244c63","year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:db88edef38aaba63fad74cd550a7d09f5e891548bf1d5717d4009fa8c2276ca0","observation_id":"e3b85eb1-9013-4316-8e68-4d2fd54bd013","resolution":{"observed_at":"2026-06-28T22:52:45.023185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:dfec01d3fda1be4dbdbd4b1223a50f99973a388ab7d4f77a7e48aa373201069b","observation_id":"94f40e8e-f01f-4221-abb8-22f127a33d48","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:3531e9deca9a2a348d97daf15a5599c6e93d0054b74015d3c95c790c7031fc2f","observation_id":"cf209860-4e7e-4ddf-9ce7-a6a5baf76384","resolution":{"observed_at":"2026-06-28T22:52:45.040992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:d99bfecc9a231a33687264d896e8cb72f6ada37a2a8e3130ae0fdbd01ebecbf7","observation_id":"c1a320b0-5b4b-4ee8-84f8-83a5cdb962c5","resolution":{"observed_at":"2026-06-28T22:52:45.053268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:ef9f920650c143eef1b9152c26593d936e18eb30b15379cf9e60cc7c2492e78f","observation_id":"5d80d2d3-40c1-4b2b-9faf-75ffbea15b5d","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:52e9eaabe3f326e9b6bd0548c3e637985e14e0c95b73390d80efc04061e56fd9","observation_id":"745a04e6-0adc-4b2a-8528-164141933463","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:a4b1835592bb09e800d3510fa26b8f8c6e00db79e25e3700b6570ad79db712c0","observation_id":"e60315ee-d4a5-4011-803e-40476e14e3b7","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Video diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:cb437cb754e00546362bb0340d5508b6b4e3ae1efda3df155e59fbd8c453cebe","observation_id":"ba03a254-e0a9-465d-8e95-708e799bea06","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Video generation models as world simulators.OpenAI Blog, 1(8):1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:9116e8311e84ffd43c3959fd11dfd3f1eacd31ef3c2adab85b26dea0e84c2790","observation_id":"1bf8bfd2-9781-4e03-9144-b47a53634ee8","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-04T06:05:54.694240Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:bd86758acb6815d9b81a51a003fbabdcf31c449499f62f29f2b03a1543a21712","observation_id":"d8b7e1ac-56f6-48d5-9137-35997613f8c2","resolution":{"observed_at":"2026-06-28T22:52:45.089912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Fast timing-conditioned latent audio diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:3f86379fa0b5516a8ee006f7d9a90748003ee4456699ecc737b6110b8fcfedd4","observation_id":"bb616b29-3bd3-4b95-9d54-9ba4a3f38f36","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:3f9f5fece3971862ed8921ced90c375cebf25aec3efaf88ad30d3409e5c946d8","observation_id":"837a96aa-b93f-47fd-9a27-44c0f3cfea77","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:0224b807b0f76ad3e6677f81cb371e877ee8a775aa3f2e3ffa886a7b99a0d1ab","observation_id":"2fb89607-e2ad-477e-83f5-343f217de10d","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:b7211f8055b82646d9718d1cab26adb706fdc8944019a4e5779f634f3130087a","observation_id":"b1aaa8ae-de63-472e-bfbc-591e12337c5d","resolution":{"observed_at":"2026-06-28T22:52:45.026191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Structured denoising diffusion models in discrete state-spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:880603d6cf0ce9924e1f66eb9dd7167e999b283692cf354a567c74d1d0aeef81","observation_id":"fa092506-52eb-4ff9-8e7e-8688c0e21167","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:1c7372cb69d3c030783561ffacd528f04a92216629ccfa6123ea392f82d512b7","observation_id":"19c7444a-1880-4bcd-88a6-2c5ee4b69167","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":"2310.16834","doi":"10.48550/arxiv.2310.16834","metadata_source":"pith","pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","venue":"stat.ML","work_id":"fcc1dcd6-aa26-420e-86d2-dc87b127ddd5","year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:9d422433a30c4b47316131efbc035674dfb00ff7aa9f30b7fb09ad234a3e764f","observation_id":"5f36f101-476b-436c-aa5d-03dab7f99630","resolution":{"observed_at":"2026-06-28T22:52:45.018190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02908","last_updated":"2025-04-30T08:39:26Z","snapshot_observed_at":"2026-07-06T19:10:29.880696Z","submitted_at":"2024-09-04T17:48:19Z","title":"Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling","version":6},"cited_work":{"arxiv_id":"2409.02908","doi":"10.48550/arxiv.2409.02908","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02908","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Masked diffusion models are secretly time-agnostic masked models and exploit inaccurate categorical sampling","venue":"arXiv (Cornell University)","work_id":"596ff052-1742-4a00-9e30-3f74803d705c","year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2409.02908","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:5eed355ec27b9b70771ec2b009e099a5bef02d5e46a7302c4a1dfa17fcc902b7","observation_id":"bae76a04-7a4d-40e3-a56c-ab8f666535e3","resolution":{"observed_at":"2026-06-28T22:52:45.009032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T17:53:20.405209+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T17:53:20.405209+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19223","last_updated":"2025-10-12T15:42:47Z","snapshot_observed_at":"2026-07-06T21:30:09.658226Z","submitted_at":"2025-05-25T16:36:20Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","version":2},"cited_work":{"arxiv_id":"2505.19223","doi":"10.48550/arxiv.2505.19223","metadata_source":"pith","pith_arxiv_id":"2505.19223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","venue":"cs.LG","work_id":"ebe72b3e-b18c-4784-8c3d-d7bfda67e098","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.19223","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:944a788817ef456caef9a5e6a8ac65c79badaea44f6633798358ff945a338a3a","observation_id":"b96fecb9-184c-4972-8f1a-2e88775f9980","resolution":{"observed_at":"2026-06-28T22:52:45.011857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-07-06T21:10:27.209188Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e24c1ebadbee4ee8ffe1f64e551ad11c885c9d643da020b8aee211c41e3d31db","observation_id":"e39905c6-0a80-403e-992b-40487d217b6b","resolution":{"observed_at":"2026-06-28T22:52:45.087047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.08838","doi":"10.48550/arxiv.2507.08838","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"wd1: Weighted policy optimization for reasoning in diffusion language models.arXiv preprint arXiv:2507.08838","venue":"ArXiv.org","work_id":"127e8eef-f734-4f65-bb7d-83a8835bc6f4","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e5d11388d12c5d419118bb0fa8203b8e57b37ba3b42d6290792be891bf5aea89","observation_id":"d7ddf474-6dc3-4b0f-802c-c3c9644fa8f9","resolution":{"observed_at":"2026-06-28T22:52:45.034643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11683","last_updated":"2026-05-29T17:51:48Z","snapshot_observed_at":"2026-08-04T10:10:04.050599Z","submitted_at":"2025-10-13T17:47:50Z","title":"Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models","version":3},"cited_work":{"arxiv_id":"2510.11683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11683","snapshot_observed_at":"2026-07-02T07:26:45.585474Z","title":"Boundary-guided policy optimization for memory-efficient rl of diffusion large language models","venue":"cs.LG","work_id":"7a22e587-7d3f-42f6-a724-9dfdeb4632a5","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2510.11683","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:1fb830c81dc0fafbbe4768221b607745fc9c860ded0e4a5fa734b0fcf019abe0","observation_id":"88a79c40-5ca8-4ad1-a4da-a42158ee6fa6","resolution":{"observed_at":"2026-06-28T22:52:45.140872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:52:45.050589Z","title":"dvoting: Fast voting for dllms","venue":null,"work_id":"3f3f9a94-8a19-4a7b-bd29-42b8764a1717","year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:dcac634a7e3958c466b0c84ab046aead14cf826cbccfb20a68c847660d061275","observation_id":"369f6c19-6d0e-4a61-bf92-8da3223737cc","resolution":{"observed_at":"2026-06-28T22:52:45.052147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10903","doi":"10.48550/arxiv.2504.10903","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient reasoning models: A survey","venue":"ArXiv.org","work_id":"4923c1ac-75d5-43c9-85a0-16f3b13d7ea8","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:57bf4f9e21261f8dba48a4cf11e5c4fdaafd1f99c8a256de59b7d619bb03c4af","observation_id":"ae53f91f-459a-4eb9-a811-0660bc53df32","resolution":{"observed_at":"2026-06-28T22:52:45.020718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:c42ee90bd659984eaaa823a46272d6d192890ebcbee9e7e1c030d4589314690b","observation_id":"6939d29e-488c-4439-aea2-ed4237fc773b","resolution":{"observed_at":"2026-06-28T22:52:45.090923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-07-19T23:18:15.337538Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"cited_work":{"arxiv_id":"2505.16839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16839","snapshot_observed_at":"2026-07-11T03:07:51.804158Z","title":"Lavida: A large diffu- sion language model for multimodal understanding.CoRR, abs/2505.16839","venue":"cs.CV","work_id":"137aa257-d405-4617-a62a-b313838b9956","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.16839","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:fd832826c47f5f7c93ee74253eedd7a6520be0b26109f1a4d92ab19f7b86287c","observation_id":"fd99a98f-a9e7-4732-b85d-664f1c3a7ae7","resolution":{"observed_at":"2026-06-28T22:52:45.004416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:bd152c8b639c002e2ac3de5db1e750956c3ba4a9dad0550ba827759d590182cc","observation_id":"9ae228eb-72a0-4e85-a531-164d1de881bb","resolution":{"observed_at":"2026-06-28T22:52:45.042761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-01T20:24:21.885586Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"cited_work":{"arxiv_id":"2506.20639","doi":"10.48550/arxiv.2506.20639","metadata_source":"pith","pith_arxiv_id":"2506.20639","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffu- coder: Understanding and improving masked diffusion mod- els for code generation.arXiv preprint arXiv:2506.20639","venue":"cs.CL","work_id":"174cb4e5-25ae-4cca-b4e2-405cbd5774ba","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2506.20639","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:2e9a7aba19cbb3cafa4fcfb056701978c2af0f3e7c7e9682afff39111f9cc20a","observation_id":"8f1b375b-00ca-4521-9b9a-889899d0de85","resolution":{"observed_at":"2026-06-28T22:52:45.144554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"contributors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:334bfaf35271aea67702234cf334e6b792edf6c4a98f6593db241341d61aa45e","observation_id":"33381d50-e5d6-43a9-8aa3-0b118810b646","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.13759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T17:35:51.719402Z","title":"Discrete diffusion in large language and multimodal models: A survey","venue":null,"work_id":"58bdb31e-9c01-4d67-bf4e-bae971b88a56","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:9c9c3169e83e1d4e63e3e1d5e530e8906f336120597e4276b477dbb7c2893cd5","observation_id":"557ddb97-068f-48fd-865d-2006575d4d09","resolution":{"observed_at":"2026-06-28T22:52:45.133729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-07-06T22:13:04.624677Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2508.10875","doi":"10.48550/arxiv.2508.10875","metadata_source":"pith","pith_arxiv_id":"2508.10875","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lavida: A large diffusion model for vision-language understanding.Advances in neural information process- ing systems, 2025b","venue":"cs.CL","work_id":"e44cc99a-c47c-4c26-9848-e709df566178","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2508.10875","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:2bdff3bb6366b5d6a529640bc7621fbda3d82e17f1e2829f8e1487ffa2a90047","observation_id":"212b589b-0cd3-4c28-886d-61984ddd3a37","resolution":{"observed_at":"2026-06-28T22:52:45.088162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"cited_work":{"arxiv_id":"2604.08302","doi":"10.48550/arxiv.2604.08302","metadata_source":"pith","pith_arxiv_id":"2604.08302","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","venue":"cs.LG","work_id":"3b4ffacd-f9f2-4ce1-952d-12a9b4425b27","year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2604.08302","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:afb7157fcac28266861e6d25f3ff5f7ff7bd791cf28839f595587ce35c73ba68","observation_id":"284a7712-27d3-41e7-8778-07cb93c37838","resolution":{"observed_at":"2026-06-28T22:52:45.153989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Edge-moe: Memory-efficient multi-task vision transformer architecture with task-level sparsity via mixture-of-experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:b1186a48ba01c894066bc2b1be303ed381258630c2437a7bd1fd976220647da2","observation_id":"ab488afc-5451-4c6a-a46c-aeb37f1a0893","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:6183bdfe9d5ea5383ec9362c740dfcbf5d105d0c6f8f5b41186162d2a4b96b2e","observation_id":"e6e87b32-4e92-42ca-bfa7-29e71684af2a","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Self-distillation: Towards efficient and compact neural networks.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(8):4388–4403, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:ea41666da19076b6d143f3789599c39b097735f257230bfee034dc47026c75d9","observation_id":"d41c42f3-c0dd-4398-94b2-597ab419374f","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13(9):9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:26dd1531a6122c2b3485ee52541dc554a0fdf35461b94970051d91be58961639","observation_id":"df22d61c-05bf-465c-a469-d18a23d2d37b","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.04178","doi":"10.48550/arxiv.2506.04178","metadata_source":"pith","pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenThoughts: Data Recipes for Reasoning Models","venue":"cs.LG","work_id":"c7acbe41-27a0-4773-a7be-8f08d86cdf21","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:90123d1046e6c02a4a65dbe09223895e6a121d5f22e39edbca9580aaa07e0ac4","observation_id":"dbbcf078-403d-4e97-b734-e92d41980569","resolution":{"observed_at":"2026-06-28T22:52:45.132201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:26:57.149499Z","title":"Can mllms guide me home? a benchmark study on fine-grained visual reasoning from transit maps","venue":null,"work_id":"091a3cea-e51b-4619-aa05-6dd854c38cb7","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:604486701b97135d889063cdcf3ca58be18b6a55db61b9f216e29d1199f4996d","observation_id":"ee5a556f-7e5d-4f09-aec6-01a3d16038b7","resolution":{"observed_at":"2026-06-28T22:52:45.122181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.20198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:09:59.546363Z","title":"arXiv preprint arXiv:2507.20198 , year=","venue":null,"work_id":"8930872a-e185-4caa-b060-47b1faecb52f","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:638c25754f5c414610f62c4377caf186c5539ab8a58b46e02f0ae58e939fc520","observation_id":"8984aee7-a022-4d46-a75e-02077e4df300","resolution":{"observed_at":"2026-06-28T22:52:45.148231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:51.237121Z","title":"arXiv preprint arXiv:2510.06751 (2025)","venue":null,"work_id":"c4e950ed-d7bc-4921-91f6-1849e874d5f1","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e13f0feb705e6cf7dbe6bb2f66d92367617f44320c001f8105c186f08ac7e8b4","observation_id":"d2c2f2df-9c25-481f-8b07-596682f91add","resolution":{"observed_at":"2026-06-28T22:52:45.134927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:26:57.123842Z","title":"Rewardmap: Tackling sparse rewards in fine-grained visual reasoning via multi-stage rein- forcement learning","venue":null,"work_id":"2a28043b-68c8-4c0f-b315-a639af606b8f","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:0bfbe9198c2e8da5b819a564c3b7ff6d00d7b603ede6a09a9cc90b1cb5379c4a","observation_id":"b4667d7c-378e-429e-b8b9-b24a84da5f66","resolution":{"observed_at":"2026-06-28T22:52:45.141475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2511.14582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.14582","snapshot_observed_at":"2026-07-04T16:49:57.270814Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","venue":"cs.CV","work_id":"11cefd6d-51f2-4797-a8bf-37c54c7fc91f","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2511.14582","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:a5455b42554bb9a19642de606f30060c7032ffc7a185f4ab140bffbb07100795","observation_id":"01159aa5-88b2-4c1e-ad75-536ccc556805","resolution":{"observed_at":"2026-06-28T22:52:45.065126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23479","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.124158Z","title":"Mergemix: A unified augmentation paradigm for visual and multi-modal understanding","venue":null,"work_id":"52067c81-1361-41b0-a606-270ddeb8bd49","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:bb3108ddbf9261e7e35d798263f458fb128701672be4fcbcaa2ef0ebad120418","observation_id":"c1238e7c-a097-4e82-af97-6cca990b00b3","resolution":{"observed_at":"2026-06-28T22:52:45.073076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10977","last_updated":"2026-05-23T02:41:17Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-09T01:09:01Z","title":"PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks","version":2},"cited_work":{"arxiv_id":"2605.10977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10977","snapshot_observed_at":"2026-06-28T22:52:45.073651Z","title":"PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks","venue":"cs.CR","work_id":"9502e678-707c-433e-8907-e8f93290ef4f","year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2605.10977","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:006f545c32035166a7ccd4c69bce452586013bd6d5c5a795399a821ef86c9588","observation_id":"26618440-c9a9-4ec9-8a58-fa9f5fd9c738","resolution":{"observed_at":"2026-06-28T22:52:45.075925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:50:51.900169Z","title":"Which heads matter for reasoning? rl-guided kv cache compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:371298643562d1bcbff7fe636810dedd7695cd5e47223172de06bc9df6483a8b","observation_id":"d7a3aeeb-16be-42d6-8fb4-b9c661167415","resolution":{"observed_at":"2026-06-28T22:50:51.900169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":51,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2605.30876."}