{"as_of":"2026-08-05T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4888dc215f38bc8a153a34c79a022a37c253dc8f306b23d3f71b56deef624abf","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T18:53:20.911374Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":81,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:36:12.980619Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:07:51.909523Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2601.10348","last_updated":"2026-05-21T06:29:24Z","snapshot_observed_at":"2026-08-03T01:57:39.427752Z","submitted_at":"2026-01-15T12:45:05Z","title":"Training-Trajectory-Aware Token Selection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T11:41:21.275802Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2601.10348"},"observation_digest":"sha256:20a62709b29555696f061250b3db5302b3d4dda7228c7c80e7ad327ba2fac02b","observation_id":"a0fc9c13-c7f1-4661-81ff-ae54e3d92d2e","resolution":{"observed_at":"2026-05-22T11:41:29.581897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-03T06:22:03.580447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22985","last_updated":"2026-05-29T12:28:23Z","snapshot_observed_at":"2026-08-03T06:22:00.885055Z","submitted_at":"2026-01-30T13:51:20Z","title":"dgMARK: Decoding-Guided Watermarking for Diffusion Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:22:03.580447Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2601.22985"},"observation_digest":"sha256:6334541455d16c7bc58e713a42d1ae733e5162da0d08adf01a75e58e97ca9368","observation_id":"1aa9a983-ebfc-45df-97e1-b1db0816efd7","resolution":{"observed_at":"2026-08-03T06:22:03.580447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-03T05:45:41.842845Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.842845Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:138a694e8996a9a3cab883bb54b5206147d59174db9fc7785b15eed94b441f30","observation_id":"76555a29-24b3-4b02-9b3a-4a097edaea0c","resolution":{"observed_at":"2026-08-03T05:45:41.842845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-03T04:07:42.697483Z","title":"Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y ., English, Z., V oleti, V ., Letts, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05992","last_updated":"2026-06-17T04:52:05Z","snapshot_observed_at":"2026-08-03T04:07:41.584536Z","submitted_at":"2026-02-05T18:41:38Z","title":"DSB: Dynamic Sliding Block Scheduling for Diffusion LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T04:07:42.697483Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2602.05992"},"observation_digest":"sha256:d849e2e4f4e1da4a24bddbec48e7a87b1f234108fc92ff3267213713942ebe57","observation_id":"4a6d5c32-bbf4-4cbe-8305-b86c7fb612db","resolution":{"observed_at":"2026-08-03T04:07:42.697483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2602.08404","last_updated":"2026-08-03T02:35:28Z","snapshot_observed_at":"2026-08-05T10:21:58.551388Z","submitted_at":"2026-02-09T09:05:46Z","title":"TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T06:49:09.078266Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2602.08404"},"observation_digest":"sha256:82824690b4fced77ee46ce7029774d873f06e1ca4060732d18b0376090e9b12a","observation_id":"dc3f62e1-ded3-446a-9021-5aa2c1b08ad2","resolution":{"observed_at":"2026-05-25T06:50:28.201459Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-04T06:08:58.900178Z","title":"Chen, C., Borgeaud, S., Irving, G., Lespiau, J.-B., Sifre, L., and Jumper, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08404","last_updated":"2026-08-03T02:35:28Z","snapshot_observed_at":"2026-08-05T10:21:58.551388Z","submitted_at":"2026-02-09T09:05:46Z","title":"TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:08:58.900178Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2602.08404"},"observation_digest":"sha256:f6031364cc6334c0beb0ae93086442fcc0a1cdfaf8d48de288b339d18ac3c8c8","observation_id":"fa6f7389-67c6-4ea2-a2be-57670a20d23d","resolution":{"observed_at":"2026-08-04T06:08:58.900178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-02T23:50:33.240614Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12586","last_updated":"2026-05-27T16:01:59Z","snapshot_observed_at":"2026-08-02T23:50:30.882987Z","submitted_at":"2026-02-13T03:56:22Z","title":"Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T23:50:33.240614Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2602.12586"},"observation_digest":"sha256:45558010c939867cda5417443118a3df74b1392155f6054e4ea104bd83c465fe","observation_id":"920562e6-a34f-4846-ac6d-8f1285e32232","resolution":{"observed_at":"2026-08-02T23:50:33.240614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2603.07475","last_updated":"2026-08-02T20:40:52Z","snapshot_observed_at":"2026-08-05T10:22:04.718440Z","submitted_at":"2026-03-08T05:31:52Z","title":"A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T15:03:23.792608Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2603.07475"},"observation_digest":"sha256:fde6698f1ad3e47c92dc298b7f70cd437e59c3cf1b8095d4c93eb359901cd841","observation_id":"29fdb8eb-1951-4957-a7a6-5cfaba4849de","resolution":{"observed_at":"2026-05-15T15:06:10.115633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-04T05:57:07.905348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.07475","last_updated":"2026-08-02T20:40:52Z","snapshot_observed_at":"2026-08-05T10:22:04.718440Z","submitted_at":"2026-03-08T05:31:52Z","title":"A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T05:57:07.905348Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2603.07475"},"observation_digest":"sha256:342a0871f424454c2500d95310dee2f1941db51ebda4559b78712b524b9f4bc3","observation_id":"f60d48eb-0214-417b-aeea-e7bb60fef2f6","resolution":{"observed_at":"2026-08-04T05:57:07.905348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2603.20216","last_updated":"2026-05-18T12:18:05Z","snapshot_observed_at":"2026-08-02T09:54:14.119916Z","submitted_at":"2026-03-03T09:56:53Z","title":"Locally Coherent Parallel Decoding in Diffusion Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T12:04:40.899362Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2603.20216"},"observation_digest":"sha256:22c363cd76fb6b463873fc39a2e20825f0caf124c46490eaf50f14d5c9d520ae","observation_id":"1edaaafb-279c-44b9-8de8-a26b3c7040b6","resolution":{"observed_at":"2026-05-21T12:05:04.914128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.02560","last_updated":"2026-04-02T22:21:24Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T22:21:24Z","title":"Dependency-Guided Parallel Decoding in Discrete Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:37:29.906503Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.02560"},"observation_digest":"sha256:5992cb2d05268e74be8f421239956ec370f9a7b3f763f9943c420b0f04e4e324","observation_id":"45222165-0b6e-4bc4-882e-aeba8495d945","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.06779","last_updated":"2026-05-12T01:06:55Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:50:00Z","title":"VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:08:03.771557Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.06779"},"observation_digest":"sha256:21f75ef034a163644c855f7bb4a5314114098acb7fe924cddaa1ee46c66779f6","observation_id":"29dde67c-399c-430a-97e0-21ed3c88492c","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.06779","last_updated":"2026-05-12T01:06:55Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:50:00Z","title":"VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:01.321456Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.06779"},"observation_digest":"sha256:31362344ba6ccb3042d141b9cb4ebaade2df1d8f1aec1a611513482ebc64ea1c","observation_id":"40415775-1010-4220-88cb-5509a2685472","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:58:17.880199Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:59b45e26824f061f62453c496c260558c49e6c6e4cc4925fd2ceb10d14819c04","observation_id":"b3e9ea55-bd62-47b3-869d-2f2a1c50d817","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T16:46:56.743268Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:8f9d4efef0145099104b4245816f55bbcb4aac5daa00a036cb7171201a62844e","observation_id":"12594179-ddca-4ec0-967c-e0fa93041e18","resolution":{"observed_at":"2026-05-19T16:47:40.076018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.09450","last_updated":"2026-05-17T13:20:28Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T16:07:14Z","title":"ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:54.441128Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.09450"},"observation_digest":"sha256:c0e7a5a8d8978d99b0142a91cb5cda2d3e7eaaac5a9c2d474641e0b5b309aa84","observation_id":"dfd6a35d-d3ad-4856-ac38-d4321a01a29d","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.09450","last_updated":"2026-05-17T13:20:28Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T16:07:14Z","title":"ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T08:52:04.531938Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.09450"},"observation_digest":"sha256:f51aab36f5f038c188b689d9b39ab1ec46a6fa7aeb07cd58465f50d3467773d8","observation_id":"bf8a28ee-ca14-430b-a886-b9fec70f99b0","resolution":{"observed_at":"2026-05-21T08:54:05.846658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.15750","last_updated":"2026-04-17T06:53:27Z","snapshot_observed_at":"2026-07-06T23:03:12.000381Z","submitted_at":"2026-04-17T06:53:27Z","title":"DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T08:50:10.064801Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.15750"},"observation_digest":"sha256:2e9c7b94b790d11587ea1105bac2a5bf4edf1abc79f6c1f724f7d1ee49a6f4b2","observation_id":"606f88ca-937f-4997-9323-511070360c99","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.17068","last_updated":"2026-04-18T17:04:10Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T17:04:10Z","title":"Stability-Weighted Decoding for Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T06:12:37.804816Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.17068"},"observation_digest":"sha256:a352cc1d093aea57675d85cd582a7fafb2be07b8579b0d63083e276f0cbfeca3","observation_id":"4fd03cae-bf81-41f0-b7bb-d430896728b9","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.20796","last_updated":"2026-04-22T17:20:42Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:20:42Z","title":"LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T00:49:38.156237Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.20796"},"observation_digest":"sha256:bc1886994539270387af4db2782275402ce34c31009c88de5481ec42005942b8","observation_id":"99ab31a6-e3eb-410f-9bec-09427c30e152","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2604.26985","last_updated":"2026-06-06T20:43:37Z","snapshot_observed_at":"2026-07-31T17:57:12.256316Z","submitted_at":"2026-04-28T19:34:04Z","title":"Simple Self-Conditioning Adaptation for Masked Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T16:38:22.306140Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2604.26985"},"observation_digest":"sha256:1056de2f580e41b966aeb46b1a06fe8bbbaa316ee65f9a02885cbe07e070d5f9","observation_id":"96ad1d12-408d-4b84-8772-26e51e4a42d5","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.01373","last_updated":"2026-05-02T10:46:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-02T10:46:56Z","title":"Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T14:59:49.792976Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.01373"},"observation_digest":"sha256:0de142a798e20678c11da45e1f5e2441469aaf0c8f0140bddc3ac97d83cab2d1","observation_id":"6adb80a2-e705-4bf8-a236-74a4592f01e1","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-03T05:59:23.145937Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-08T16:06:47.108382Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:6d3013be9faf9b176406b4bcc4f15d922bd9d0e9848643a74496b0d617fbc587","observation_id":"48c73390-d4e3-4284-8820-81bd039aeb49","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-03T05:59:23.145937Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-13T01:48:36.105389Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:964d5b00faeedbfe544079ad7bfc4358d2a24d1c80709f0018862a8d81dfe52e","observation_id":"cd4c4097-0382-4d95-8bfe-b24c7bae66a8","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.09291","last_updated":"2026-05-10T03:36:49Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:36:49Z","title":"dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-12T03:52:05.779559Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.09291"},"observation_digest":"sha256:1584f11a9d1616a7759bec117cfa955011e4122b6f65e77e17d39c210ac6704e","observation_id":"07523fd8-9b6d-429f-9976-48cc9c1e0a3f","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.09397","last_updated":"2026-05-10T07:50:02Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:50:02Z","title":"BadDLM: Backdooring Diffusion Language Models with Diverse Targets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:13.417357Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.09397"},"observation_digest":"sha256:1a71adb8ff1d60fa444532a68b52fbd8562468400a5432b74133ba4759e89969","observation_id":"8c8d8c97-0e1f-4f3d-a2ce-5824448440cb","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.09536","last_updated":"2026-05-10T13:38:53Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T13:38:53Z","title":"TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T05:01:03.570848Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.09536"},"observation_digest":"sha256:163731205ef8910169de3387bf30305782671aab67b54b1ce7e09f6f0294663d","observation_id":"59815ad2-e213-41c3-8222-c036b250280a","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.10020","last_updated":"2026-05-11T05:44:40Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T05:44:40Z","title":"TrajDLM: Topology-Aware Block Diffusion Language Model for Trajectory Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:57:11.330058Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.10020"},"observation_digest":"sha256:57274f94d0c4070edda023064c5087d0c0f58d79db1ca873a4a0be69e5f5e642","observation_id":"3252877a-a718-40d6-9f48-ecbb4aa70aa1","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.10218","last_updated":"2026-05-11T08:58:40Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:58:40Z","title":"Relative Score Policy Optimization for Diffusion Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:42.196931Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.10218"},"observation_digest":"sha256:3ce0564bdb1c99c04df6a03e7ebad093ed2da70278eb657fd7d483fef11be460","observation_id":"23c5f481-6b83-451a-a430-04561e561e37","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.10518","last_updated":"2026-05-11T13:07:03Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:07:03Z","title":"Infinite Mask Diffusion for Few-Step Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:05:57.880725Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.10518"},"observation_digest":"sha256:6a0125220db95cbdd059dceaec2858ca47d13b965457195a1f2db181566f583f","observation_id":"269feddb-01d4-4815-875e-d4246141ffc6","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.10980","last_updated":"2026-05-09T03:26:23Z","snapshot_observed_at":"2026-08-03T23:55:49.563674Z","submitted_at":"2026-05-09T03:26:23Z","title":"LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T00:57:24.203834Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.10980"},"observation_digest":"sha256:e5107f1c58cbde9694e549a36c2f4e728df346617b8b06504b357e364b7e4499","observation_id":"0ffb6047-a756-48e8-a485-8f298d569648","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.11577","last_updated":"2026-05-12T06:02:59Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:02:59Z","title":"BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:23.273159Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.11577"},"observation_digest":"sha256:d56fd42a4f6daf9829cce50b70a0fcdb2615b1d9c0907d22ef7ae4233be16632","observation_id":"3ee89c69-1a9c-439f-8036-26aa3f62e884","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:03:00.503644Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:4800210e9008d5c95e7fc8efd2a5ebef3325092981451d209a1d30ec531029b5","observation_id":"6d5f2368-e30b-4b53-a9aa-632ac323878e","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:06:01.667173Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:de8eaf2c93c2589aace38f1eb9004ac6e7e8e377ae9a88364ed97b88e5ca47e1","observation_id":"790b9ce7-ab62-4013-ab80-da3222aeb784","resolution":{"observed_at":"2026-05-14T21:19:28.293703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.12522","last_updated":"2026-04-04T17:30:35Z","snapshot_observed_at":"2026-08-02T09:51:20.420159Z","submitted_at":"2026-04-04T17:30:35Z","title":"Differences in Text Generated by Diffusion and Autoregressive Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:59:06.804446Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.12522"},"observation_digest":"sha256:9313c1060cd8c278648325e14c951bb8971a29bd714b870a60b58f7fa692fd85","observation_id":"4d266446-d491-4d40-bdb5-42a3feade11c","resolution":{"observed_at":"2026-05-14T20:59:27.045479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.13026","last_updated":"2026-07-23T12:29:23Z","snapshot_observed_at":"2026-08-03T18:45:40.803987Z","submitted_at":"2026-05-13T05:29:38Z","title":"Understanding and Accelerating the Training of Masked Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:04.491385Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.13026"},"observation_digest":"sha256:a076b4c189255bb3ce66f2d88c630b642158e2c41c4b6d5b23e96dbe155779b3","observation_id":"3a2c8f4e-89db-4c7e-8be9-d090b53f9f5b","resolution":{"observed_at":"2026-05-14T20:39:28.906087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-02T14:15:45.887013Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.13026","last_updated":"2026-07-23T12:29:23Z","snapshot_observed_at":"2026-08-03T18:45:40.803987Z","submitted_at":"2026-05-13T05:29:38Z","title":"Understanding and Accelerating the Training of Masked Diffusion Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:15:45.887013Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.13026"},"observation_digest":"sha256:98fc0b3c3c683e72f99d1cf46ee94c7079cad14136b45efcde66c65b92401fb6","observation_id":"870564a4-9d7b-406d-b921-2d53fd8f3d2a","resolution":{"observed_at":"2026-08-02T14:15:45.887013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.13382","last_updated":"2026-05-13T11:37:51Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:37:51Z","title":"BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T17:51:48.905620Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.13382"},"observation_digest":"sha256:ebb01937d9e5ffa3b4ca06934546491fc7d05e1cfd09a85e1f3d92d412e4e239","observation_id":"1536b044-789b-41a7-b9a7-653d24e19b45","resolution":{"observed_at":"2026-05-14T18:53:21.210170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.14305","last_updated":"2026-05-14T03:15:25Z","snapshot_observed_at":"2026-08-04T06:43:08.484166Z","submitted_at":"2026-05-14T03:15:25Z","title":"Factorization-Error-Free Discrete Diffusion Language Model via Speculative Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:41.856616Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.14305"},"observation_digest":"sha256:802144189dee8ca71ddb64805c9bdd30b1eb71b8943bf50724ad9430afd1455c","observation_id":"1ad87f19-eaa1-4e10-b84b-e140848f110f","resolution":{"observed_at":"2026-05-15T02:53:33.539967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.14465","last_updated":"2026-05-14T07:00:26Z","snapshot_observed_at":"2026-08-03T18:28:07.146194Z","submitted_at":"2026-05-14T07:00:26Z","title":"From Table to Cell: Attention for Better Reasoning with TABALIGN","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T01:31:03.738527Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.14465"},"observation_digest":"sha256:d0e110466ca841bf9b4d2d0ed22b1f44d5a25796e577f347861944aa999154ed","observation_id":"4680be7c-4435-472f-b07e-17454b447905","resolution":{"observed_at":"2026-05-15T01:33:27.331933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.18165","last_updated":"2026-05-18T10:09:10Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:09:10Z","title":"Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T13:13:05.695349Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.18165"},"observation_digest":"sha256:73b484cfbb62fe545f5084f7d36641f9e8047a64bd6c81906aca73e38b5180db","observation_id":"c2ea7126-2ea2-4d7d-b2e7-2a8552d2c8d5","resolution":{"observed_at":"2026-05-20T13:13:17.942220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.20179","last_updated":"2026-05-19T17:59:08Z","snapshot_observed_at":"2026-08-02T06:21:17.194998Z","submitted_at":"2026-05-19T17:59:08Z","title":"TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:08:07.318040Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.20179"},"observation_digest":"sha256:230bb7d4b537489e2446389ee2e99cc85848102a5b2c02fdb55f8b6a64bb5b16","observation_id":"00bcf1f7-fbe1-44f3-adc6-934c17a35432","resolution":{"observed_at":"2026-05-20T05:13:03.722203Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.20813","last_updated":"2026-05-20T07:06:54Z","snapshot_observed_at":"2026-08-02T08:54:20.689265Z","submitted_at":"2026-05-20T07:06:54Z","title":"PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T05:05:55.767705Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.20813"},"observation_digest":"sha256:e647b89972fcaf569516e9b52f3ec478885e8a31e4cac6b277eda89c75cbb897","observation_id":"251757ed-dd99-48c4-bac9-8a2ea42ca470","resolution":{"observed_at":"2026-05-21T05:09:38.738780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.24173","last_updated":"2026-05-22T19:46:08Z","snapshot_observed_at":"2026-07-06T23:34:18.555542Z","submitted_at":"2026-05-22T19:46:08Z","title":"Extracting Training Data from Diffusion Language Models via Infilling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T15:56:55.547579Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.24173"},"observation_digest":"sha256:3945bf0f18d771dbae950562fff5defd46f134da828855f8de0df399be401cf2","observation_id":"51027602-d7de-4501-a050-936d93d87aa6","resolution":{"observed_at":"2026-06-30T16:04:53.273530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.24292","last_updated":"2026-05-22T23:48:25Z","snapshot_observed_at":"2026-07-06T23:34:23.087565Z","submitted_at":"2026-05-22T23:48:25Z","title":"TUBE: Tangent Upper Bound on Evidence for Discrete Diffusion Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T15:24:48.413685Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.24292"},"observation_digest":"sha256:be7dec152acc77bdf799d83bbe87c55e8124aaf908eb073a46162e59c14bdd3f","observation_id":"d908f75d-5c66-4b7b-9982-d3479c347e4a","resolution":{"observed_at":"2026-06-30T15:34:48.432341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.24832","last_updated":"2026-05-24T02:56:46Z","snapshot_observed_at":"2026-08-03T02:41:15.110402Z","submitted_at":"2026-05-24T02:56:46Z","title":"Optimus: Elastic Decoding for Efficient Diffusion LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T00:15:58.082725Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.24832"},"observation_digest":"sha256:9f8da361812ec0bea9c9311750d737632258137d618bed34efc951888defede3","observation_id":"da0b99bf-7616-418a-b951-dd3f6cd15c06","resolution":{"observed_at":"2026-06-30T00:24:04.313139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.25893","last_updated":"2026-05-25T14:22:21Z","snapshot_observed_at":"2026-08-02T15:43:17.916684Z","submitted_at":"2026-05-25T14:22:21Z","title":"$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:03:25.762772Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.25893"},"observation_digest":"sha256:fe6ab6af43fa7ea96ad35ddb1ef46074e508c4fef88e3e279da09c9495bec580","observation_id":"b3b7718d-8fd0-446f-9b08-73e71381b57f","resolution":{"observed_at":"2026-06-29T22:03:59.826196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.26106","last_updated":"2026-05-25T17:58:24Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:58:24Z","title":"Looped Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:13:12.343355Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.26106"},"observation_digest":"sha256:0ec10057c626a4cef3eb5c37831da8678a8a24046bf5aa81a41ff0b11984dcc3","observation_id":"94bc8347-8c32-4ffa-bfa8-0b1410c3844d","resolution":{"observed_at":"2026-06-29T23:14:01.140257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:b502789da663f28d86ad9ce60b984d92940dfaa2ce4033a4219c6fbd88f7e731","observation_id":"686944ff-643e-409d-8b7c-cb9a391e0028","resolution":{"observed_at":"2026-06-29T08:53:16.327756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:5bca6a7a77cd15b9a2830927ef429f0abb0636c0aa426db7278f4e0165fd117b","observation_id":"b0b19b3c-6c06-4cd6-8eb0-5236d28d8b7c","resolution":{"observed_at":"2026-06-28T22:52:45.017324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.00997","last_updated":"2026-05-31T04:25:36Z","snapshot_observed_at":"2026-07-31T08:30:04.997354Z","submitted_at":"2026-05-31T04:25:36Z","title":"Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:47:16.712668Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.00997"},"observation_digest":"sha256:d9e251b954e47e09d0cc294b5aa27d677bf6752cf1598981ff3ddb36fac38501","observation_id":"df96bbc9-79f7-4f88-a43e-ede695996318","resolution":{"observed_at":"2026-07-01T20:46:13.563458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.01024","last_updated":"2026-05-31T05:27:01Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:27:01Z","title":"DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T17:39:11.170970Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.01024"},"observation_digest":"sha256:0882666d7ec94f2ab9ec2c2f844652160e15e5b813e1beecdfadd662d8f0af36","observation_id":"1359391e-50f2-49ba-b468-b2a03efd25fc","resolution":{"observed_at":"2026-07-01T20:46:14.274937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.02544","last_updated":"2026-06-01T17:46:46Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:46:46Z","title":"SimSD: Simple Speculative Decoding in Diffusion Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T14:58:00.723105Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.02544"},"observation_digest":"sha256:cdaefc77bc9eceda1368795bf4b349b11f0e9f6a34ce49c7432c1a347a1e8de9","observation_id":"d056a4d7-1895-46d3-8939-952cfa5db869","resolution":{"observed_at":"2026-07-01T22:56:19.514977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.04027","last_updated":"2026-06-01T18:10:21Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-01T18:10:21Z","title":"MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T13:43:51.171443Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.04027"},"observation_digest":"sha256:20029f7d07d566d0ac8e5c181e9be712947f8e121bd74cf3e0e9af3bcdce5df4","observation_id":"2f215eea-3f38-4a31-ac9b-68f429b3ea2c","resolution":{"observed_at":"2026-07-01T23:56:24.395256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.06712","last_updated":"2026-06-04T20:58:08Z","snapshot_observed_at":"2026-07-06T23:46:28.942186Z","submitted_at":"2026-06-04T20:58:08Z","title":"Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T01:21:52.821813Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.06712"},"observation_digest":"sha256:cb8588b3a28346890cdf29b25ee1a63414d576c55b9642ea224c179a8836932c","observation_id":"77978734-4a0c-468c-b6b5-3ad0dbbbedb4","resolution":{"observed_at":"2026-07-02T13:26:58.854711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.06888","last_updated":"2026-06-09T06:01:51Z","snapshot_observed_at":"2026-08-01T16:12:34.477524Z","submitted_at":"2026-06-05T04:10:09Z","title":"Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T22:24:01.067388Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.06888"},"observation_digest":"sha256:426eed6f2b153d39b1c580e8f3c26e91fb6da790edfc777987d3b08129caf14d","observation_id":"160c9771-1d3a-40d2-90ec-6e0d90abf4eb","resolution":{"observed_at":"2026-07-02T16:47:09.801223Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.09159","last_updated":"2026-06-08T07:50:12Z","snapshot_observed_at":"2026-07-06T23:48:35.190418Z","submitted_at":"2026-06-08T07:50:12Z","title":"Unified Energy for Invariant and Independent Decoding in Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:51:04.460958Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.09159"},"observation_digest":"sha256:6857c353d082b3504c12f7e5bcca7543195d380b3f559d8069f4ddc55aebaca9","observation_id":"86092ac0-8e22-45f0-8edc-9d2cbbc431f1","resolution":{"observed_at":"2026-07-03T01:07:29.842970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.17999","last_updated":"2026-06-22T14:15:54Z","snapshot_observed_at":"2026-07-06T23:53:30.953084Z","submitted_at":"2026-06-16T14:46:53Z","title":"VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T00:42:43.220998Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.17999"},"observation_digest":"sha256:344f30e5ef1493ccae685da3bf6b736fc2188640728d7381c8497717ecd946b0","observation_id":"611599ff-5fd1-4009-88c5-e9b05e923242","resolution":{"observed_at":"2026-07-03T21:18:59.376265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.18195","last_updated":"2026-06-25T16:08:43Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:24:57Z","title":"Learning from the Self-future: On-policy Self-distillation for dLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T01:20:14.919054Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.18195"},"observation_digest":"sha256:b0e3025f4f0370a2699741cc904ba8aba3ab3e4a4a15657ace2eb20b362c70fb","observation_id":"468159fb-c3b4-47d7-9661-5694f1944f8f","resolution":{"observed_at":"2026-07-03T20:28:55.659824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:0d9159e54097704401d1ae851f7eb859d5ab70e6bf513ae354e2c72b87ed9ac9","observation_id":"dc8738d5-5022-437b-ac97-d5cc843b92b1","resolution":{"observed_at":"2026-07-04T00:49:18.039142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.21633","last_updated":"2026-08-03T07:03:11Z","snapshot_observed_at":"2026-08-05T10:22:28.029613Z","submitted_at":"2026-06-19T17:36:51Z","title":"HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:44:11.281545Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.21633"},"observation_digest":"sha256:432625568d368b3f2fa7fd34698814b550a36bed244dc0ae73b02bbe8ceed66f","observation_id":"74c101ad-53ac-4eaf-bb4a-a677af5f394f","resolution":{"observed_at":"2026-07-04T06:09:37.904123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-04T04:42:23.978529Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21633","last_updated":"2026-08-03T07:03:11Z","snapshot_observed_at":"2026-08-05T10:22:28.029613Z","submitted_at":"2026-06-19T17:36:51Z","title":"HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T04:42:23.978529Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.21633"},"observation_digest":"sha256:d2869223d7148e847bab9090e650aa40694e50bcd62d7f37318bfe5dc1d814aa","observation_id":"43d93d9a-f6f8-45b3-aecb-5781a6ad902a","resolution":{"observed_at":"2026-08-04T04:42:23.978529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.24119","last_updated":"2026-06-23T04:09:58Z","snapshot_observed_at":"2026-07-06T23:58:44.541819Z","submitted_at":"2026-06-23T04:09:58Z","title":"When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T00:49:34.365193Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.24119"},"observation_digest":"sha256:a78cfa85cd26c2cd24fb7c6977861a09789879542235c1256bdd84272033a8ad","observation_id":"d9420ae1-68ee-4834-ba89-3650b4a473a3","resolution":{"observed_at":"2026-07-04T16:19:56.317788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.29066","last_updated":"2026-06-27T19:51:35Z","snapshot_observed_at":"2026-08-02T05:52:50.909260Z","submitted_at":"2026-06-27T19:51:35Z","title":"Masked Diffusion Decoding as $x$-Prediction Flow","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T09:27:28.863343Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.29066"},"observation_digest":"sha256:c47f393e7faeb564d1f66ce2fb87e31fc10aa56217779887d9c03dfc98a68e64","observation_id":"c04aa8b5-6863-40c5-a46c-2c51b335813a","resolution":{"observed_at":"2026-06-30T09:34:34.799143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.29215","last_updated":"2026-06-30T11:21:37Z","snapshot_observed_at":"2026-08-03T18:17:11.319044Z","submitted_at":"2026-06-28T05:53:45Z","title":"Multi-Block Diffusion Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-30T08:53:31.494892Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.29215"},"observation_digest":"sha256:edf1ce166c4a8bfa7ddabb4d2b0f48c29d1baf287d63d32b3d7b4820eed43200","observation_id":"21208153-95e8-4b7e-9e43-3ec068dd15f5","resolution":{"observed_at":"2026-06-30T08:54:29.548537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.29215","last_updated":"2026-06-30T11:21:37Z","snapshot_observed_at":"2026-08-03T18:17:11.319044Z","submitted_at":"2026-06-28T05:53:45Z","title":"Multi-Block Diffusion Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T07:04:06.161855Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.29215"},"observation_digest":"sha256:4bf36bcfc2e322ae03e6106c604d4e0ca13dfb553419a8e286f55783503697c1","observation_id":"c0fe317b-7427-49ad-b747-21740ca223c6","resolution":{"observed_at":"2026-07-01T07:05:28.290602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.29228","last_updated":"2026-07-01T01:03:45Z","snapshot_observed_at":"2026-08-01T18:13:34.295031Z","submitted_at":"2026-06-28T06:31:36Z","title":"Understanding Evaluation Illusion in Diffusion Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T07:52:46.014306Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.29228"},"observation_digest":"sha256:515397bf46acddd95117944697ec6f7fb353662ba013918f016ba3b4791f37a3","observation_id":"5acb4afe-f819-4349-8638-3107355a20b3","resolution":{"observed_at":"2026-06-30T07:54:21.830492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.29228","last_updated":"2026-07-01T01:03:45Z","snapshot_observed_at":"2026-08-01T18:13:34.295031Z","submitted_at":"2026-06-28T06:31:36Z","title":"Understanding Evaluation Illusion in Diffusion Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T20:52:08.330407Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.29228"},"observation_digest":"sha256:7ebfa955b12a9c076c49093e4d13c50fe2bba390289c69a0a59acb206b39d7fa","observation_id":"fdc6e66b-4660-48d0-b670-00addbd29a28","resolution":{"observed_at":"2026-07-02T20:57:22.858880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.31585","last_updated":"2026-06-30T12:38:58Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:38:58Z","title":"DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T05:39:21.642584Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.31585"},"observation_digest":"sha256:5ee7a58418c44e22b7180882e533192dde8cd2f251e21a2ca8c26da8929cf32c","observation_id":"45644394-85eb-4425-b213-f38ed0f7cd14","resolution":{"observed_at":"2026-07-01T10:15:44.858875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2607.00208","last_updated":"2026-06-30T21:38:46Z","snapshot_observed_at":"2026-07-07T00:05:54.401681Z","submitted_at":"2026-06-30T21:38:46Z","title":"SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T19:05:59.651008Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.00208"},"observation_digest":"sha256:87dc0b6ed1913b8fb1bd3aa1598bf528fe50484d1001e35b85f70002e5b531a5","observation_id":"67dfd7bf-37f5-4a16-869c-f5c679559e45","resolution":{"observed_at":"2026-07-02T19:07:17.201188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-12T03:56:26.770729Z","title":"Llada2.0: Scaling up diffusion language models to 100b, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03236","last_updated":"2026-07-03T11:45:21Z","snapshot_observed_at":"2026-07-12T03:56:26.107275Z","submitted_at":"2026-07-03T11:45:21Z","title":"TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T03:56:26.770729Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.03236"},"observation_digest":"sha256:463f4f06b53cb66cbaef47b1d193e108ee327a3189ea5f20773b78815f102d57","observation_id":"03ec835e-a87c-491c-bb23-241cb4434303","resolution":{"observed_at":"2026-07-12T03:56:26.770729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T20:58:04.182764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04206","last_updated":"2026-07-05T09:55:29Z","snapshot_observed_at":"2026-08-05T08:10:46.508162Z","submitted_at":"2026-07-05T09:55:29Z","title":"Sangam: Efficiently Serving Diffusion LLMs with the AR Stack","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T20:58:04.182764Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.04206"},"observation_digest":"sha256:f571fab82f89a5e67d46e074a35d957cb8130c3b7883f018a39861578963afbe","observation_id":"045768ee-11a9-4d41-9674-5a84016fdc3c","resolution":{"observed_at":"2026-07-11T20:58:04.182764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-07-11T03:04:09.555872Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:dc7a9ff178b2cb8381c7571e441eb6d7257c1d25254e87e852e147feaf7d0be2","observation_id":"c4413e59-3e50-4ec0-9c90-dba1983060ed","resolution":{"observed_at":"2026-07-11T03:07:51.938767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-02T00:49:32.353686Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14908","last_updated":"2026-07-16T12:28:01Z","snapshot_observed_at":"2026-08-02T00:49:29.309368Z","submitted_at":"2026-07-16T12:28:01Z","title":"CODA: Algorithm-Hardware Co-design for Edge Video Diffusion via NMP-Enabled Compute-Cache Operator Disaggregation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:49:32.353686Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.14908"},"observation_digest":"sha256:e18262105899a18856fd602a9c2aec04bb2a5a2b485714a98ffa8ce7bb3c5338","observation_id":"183f6b36-1026-470c-b252-68db9bde9ea4","resolution":{"observed_at":"2026-08-02T00:49:32.353686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-01T22:45:09.896002Z","title":"0: Scaling up diffusion language models to 100b , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15655","last_updated":"2026-07-17T06:04:04Z","snapshot_observed_at":"2026-08-01T22:45:07.510420Z","submitted_at":"2026-07-17T06:04:04Z","title":"Adaptive Multi-Step Lookahead Decoding for Diffusion Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T22:45:09.896002Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.15655"},"observation_digest":"sha256:e80412dace7b0074e994ff4686e86a4b616a19e44cfc8cab08c7c4366eee9a2e","observation_id":"e1cffa7c-eff4-4f2a-b8d3-e49e97bfbb94","resolution":{"observed_at":"2026-08-01T22:45:09.896002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-02T14:50:09.425202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-02T14:50:06.224987Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:09.425202Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:6fae4920582edffb41fb93115be8f02332ce68ecb2d45d68d205aa3d9c860d22","observation_id":"3d6a276a-4d55-4ba8-9deb-9c2c9aa8173e","resolution":{"observed_at":"2026-08-02T14:50:09.425202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-01T17:28:54.899015Z","title":"arXiv:2512.15745","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17652","last_updated":"2026-07-20T08:05:03Z","snapshot_observed_at":"2026-08-03T19:05:40.976043Z","submitted_at":"2026-07-20T08:05:03Z","title":"FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:28:54.899015Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.17652"},"observation_digest":"sha256:2403d3f330f3453fa6fdcf2faf84ef46d08274cbc4d0935f7ed5b507ec0f4266","observation_id":"1066b677-c40f-44a3-9ec6-b05b1980126f","resolution":{"observed_at":"2026-08-01T17:28:54.899015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-01T13:10:37.449415Z","title":"Llada2.0: Scaling up diffusion language models to 100b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19223","last_updated":"2026-07-21T15:52:50Z","snapshot_observed_at":"2026-08-01T13:10:35.664738Z","submitted_at":"2026-07-21T15:52:50Z","title":"AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.449415Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.19223"},"observation_digest":"sha256:2697b2c8d30e387e75fa1c36043647820521ddf50e01b120ce953976cfd585c9","observation_id":"e67b9939-1eb0-499f-9932-21dd604ad827","resolution":{"observed_at":"2026-08-01T13:10:37.449415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-01T07:34:06.672977Z","title":"Llada2.0: Scaling up diffusion language models to 100b, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21427","last_updated":"2026-07-23T15:29:49Z","snapshot_observed_at":"2026-08-01T07:34:03.646440Z","submitted_at":"2026-07-23T15:29:49Z","title":"Context-weighted Discrete Flow Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:34:06.672977Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.21427"},"observation_digest":"sha256:14d6658e8d0c2bbab831135b708cf4cb8bc93224bc8e13db24201dbd71623b82","observation_id":"12042f15-0c8d-4fea-8550-dee32b7df065","resolution":{"observed_at":"2026-08-01T07:34:06.672977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-01T14:25:38.284457Z","title":"2512.15745 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26504","last_updated":"2026-07-29T06:09:12Z","snapshot_observed_at":"2026-08-05T03:01:43.978442Z","submitted_at":"2026-07-29T06:09:12Z","title":"From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T14:25:38.284457Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.26504"},"observation_digest":"sha256:682d731b9d52ab95690f6d2d4113bfa45b4dd0f368da3e6db6a4660ee5e6d6f7","observation_id":"62c6eebe-f29d-4af4-930e-3cb07c7e3ba1","resolution":{"observed_at":"2026-08-01T14:25:38.284457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-05T00:36:12.980619Z","title":"Llada2. 0: Scaling up diffusion language models to 100b,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00605","last_updated":"2026-08-01T11:48:25Z","snapshot_observed_at":"2026-08-05T10:20:03.818786Z","submitted_at":"2026-08-01T11:48:25Z","title":"Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:36:12.980619Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2608.00605"},"observation_digest":"sha256:abdf45fc90ad0b9a58b529447227849aa12be09ea09fad58a6cbfeda90529a85","observation_id":"b998e15c-99e5-43e2-a9eb-f0f848c88a2c","resolution":{"observed_at":"2026-08-05T00:36:12.980619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.15745/citation-record","integrity":"/paper/2512.15745/integrity","json":"/paper/2512.15745/citation-record.json","paper":"/paper/2512.15745"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-03T23:49:05.512328Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2503.09573","doi":"10.48550/arxiv.2503.09573","metadata_source":"pith","pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","venue":"cs.LG","work_id":"b34ab928-6ffb-4028-b13c-395a8924d76b","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:79442e33d0f31e4ff97e56ee26efdb6fd2b23bb68114b361ab29e669c625cae8","observation_id":"4175717d-ae91-498e-aca3-67f837348599","resolution":{"observed_at":"2026-05-15T10:59:41.530185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:33280ad91c12d0e2eb0f73fe31ae45812727be59b2b18ea3fc8d6ddae1145780","observation_id":"00d77b3d-fcfe-43bd-a303-d1ea44df15c1","resolution":{"observed_at":"2026-05-14T18:53:20.952618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:7bf02511437c96216010295c2c4cded72a7cb7a0741a3464451def665c2a70a8","observation_id":"a6a1ef40-be6a-48ec-b87a-f1f86fe11a15","resolution":{"observed_at":"2026-05-14T18:53:20.959850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14148","last_updated":"2025-08-23T20:28:45Z","snapshot_observed_at":"2026-07-06T22:15:12.721846Z","submitted_at":"2025-08-19T16:56:51Z","title":"DPad: Efficient Diffusion Language Models with Suffix Dropout","version":2},"cited_work":{"arxiv_id":"2508.14148","doi":"10.48550/arxiv.2508.14148","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.14148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dpad: Efficient diffusion language models with suffix dropout.arXiv preprint arXiv:2508.14148","venue":"ArXiv.org","work_id":"3f0e3292-b812-4d35-9383-8e3959725c6b","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2508.14148","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:1a5a82a59639ab1c3978c6bf14959da68a6f59cccf38d31d7060aad9574c53f7","observation_id":"d59b3921-b861-4374-83d4-93cc4dd8f2a9","resolution":{"observed_at":"2026-05-14T18:53:20.966735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:ab34f9da19ee8be5fdeda5f1b910179a8f3b6d2c46d6a0b92795ff780ed4fdcc","observation_id":"3744a359-feec-4af0-9e1f-feb0c8c4d635","resolution":{"observed_at":"2026-05-14T18:53:20.973081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:38188407bb1d1fad5bcbabe0aefad64d00c418468ab95c2e5297fac35416b91c","observation_id":"a8172217-5d51-4ab9-84cf-7dd44761b983","resolution":{"observed_at":"2026-05-14T18:53:20.978083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":"1903.00161","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-07-09T12:46:14.545000Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","venue":"cs.CL","work_id":"074eb9b5-e9c6-4075-8dcb-0e4c103924c1","year":2019},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:768f39838b6ed657742e76b2ef0dfa77340182d5e7d3f5593ad3e924f0b725a3","observation_id":"e3f9aaf5-65a7-422b-a362-5f48195194ea","resolution":{"observed_at":"2026-05-14T18:53:20.984790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:afb41f4275f44c2a71d63932f4b86293960d926fee80505343a8c0f7ab554b1b","observation_id":"17d1b9ca-423f-438e-a586-6552ca628b97","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:66c91662484d8103355e9758906de33e8faf0247777127181d6e7e366844f184","observation_id":"81ff8d07-d6e1-4c92-adcb-63797cbd145e","resolution":{"observed_at":"2026-05-14T18:53:20.996879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":"2401.03065","doi":"10.48550/arxiv.2401.03065","metadata_source":"pith","pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","venue":"cs.SE","work_id":"0daed386-84ea-40ec-bdeb-546f8991fca5","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:b4f792190546138fbc0090af2f6fc0504264f1046a730c1aaba66d71bb3aac21","observation_id":"4c12010b-229c-4096-8f18-0970dd1926af","resolution":{"observed_at":"2026-05-14T20:57:16.443569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:58d7cc9c30699651a744f7ac0bb16131b25f8e49d6dc38bf28304f311ce2be36","observation_id":"a17d8acc-e574-4337-906e-516bedc540ac","resolution":{"observed_at":"2026-05-14T18:53:21.009448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:28569012ada85fcb18af70dba72fbd2b3c9482eddf4a975f487565c49e570c9e","observation_id":"48c64367-5dc8-4ab6-b96e-088c9d52319d","resolution":{"observed_at":"2026-05-14T18:53:21.015068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:5aad4f4fe90464256777015d1ad930dec8f12bf577f3652fd00a6dc0333a903f","observation_id":"3521ffe5-b619-4a42-a399-24c9086f1a3b","resolution":{"observed_at":"2026-05-14T18:53:21.020228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05444","last_updated":"2020-10-12T04:25:48Z","snapshot_observed_at":"2026-07-06T10:03:28.013826Z","submitted_at":"2020-10-12T04:25:48Z","title":"OCNLI: Original Chinese Natural Language Inference","version":1},"cited_work":{"arxiv_id":"2010.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.05444","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocnli: Original chinese natural language inference.arXiv:2010.05444","venue":null,"work_id":"5742dbe9-8116-46e2-8043-6ad189f6181a","year":2010},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2010.05444","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:8be021dfe534afc0885ac0071d8fcdc37a37dbc189e2c4a955e3627fee076805","observation_id":"f35f6ec5-583d-4096-ba57-76b69a750a5f","resolution":{"observed_at":"2026-05-14T18:53:21.025987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:5f2878e0e2b11fd9b2ec209fb9704f2bce8ea8d1f835f714d675fd64d0ae2572","observation_id":"7a403392-e4bc-4cf3-8357-9a123608a81f","resolution":{"observed_at":"2026-05-14T18:53:21.031495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:ecd12c33afc5c7127cbf46de417e3de5ff8f8bb853d1889c21b86a8e91023edd","observation_id":"ac893edd-6e14-432e-8f58-dbda32ea5bb9","resolution":{"observed_at":"2026-05-14T18:53:21.038184Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:0af42f296c54fe7bb3b73bc1c7d3bee54e04521ff9f3a8ac9cc46c570a893720","observation_id":"ecb965f2-1d8e-4091-9071-01546399a143","resolution":{"observed_at":"2026-05-14T18:53:21.044229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":"2306.09212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-06-29T19:43:55.030793Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":"cs.CL","work_id":"30c9ec62-1af0-4f30-94b4-d1ef163eff71","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:df03dd968b9be7b7da39794fba0416800789cccaa06852bd7f35c0f5f4abc23c","observation_id":"52851571-e324-4a88-b941-eca3ada0dfa3","resolution":{"observed_at":"2026-05-16T21:01:11.049549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-07-19T23:18:15.337538Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"cited_work":{"arxiv_id":"2505.16839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16839","snapshot_observed_at":"2026-07-11T03:07:51.804158Z","title":"Lavida: A large diffu- sion language model for multimodal understanding.CoRR, abs/2505.16839","venue":"cs.CV","work_id":"137aa257-d405-4617-a62a-b313838b9956","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2505.16839","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:6d0cc9fb0aa16d46918ad61a872c8e07bec5a6c66589063e7dea88bd9b445b3a","observation_id":"340b9087-75a4-4876-8b2e-84f9eebaf37d","resolution":{"observed_at":"2026-05-14T18:53:21.058965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:25.442017Z","title":"Every activa- tion boosted: Scaling general reasoner to 1 trillion open language foundation.arXiv preprint arXiv:2510.22115","venue":null,"work_id":"fb0fca62-cc3a-4b5b-80d1-c9a07b50269d","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:de9488647b4d7861b84e235ee6a07c643dc91286f43cdb902879b5ad800ba489","observation_id":"0631f03a-1550-41e2-963b-baa941a9762f","resolution":{"observed_at":"2026-05-14T18:53:21.067232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:a579cf043742d3b758691e112be100a8ddb8431877faa03c6574fc5ebf53adf9","observation_id":"cc694f49-8c3f-4e24-afa8-b7b27a817849","resolution":{"observed_at":"2026-05-14T18:53:21.073800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.08923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:52.191436Z","title":"Tidar: Think in diffusion, talk in autoregression","venue":null,"work_id":"ee07aeca-ea93-4394-85e4-7bbe1b5565d0","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:79e913296431809aa20b990c9aaf7aaa99efda22fa802aa2c291ee6099a42a4a","observation_id":"54baad4c-d4b0-41e4-8fd2-f3be0378e8e2","resolution":{"observed_at":"2026-05-14T18:53:21.082194Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02317","last_updated":"2025-08-07T10:31:09Z","snapshot_observed_at":"2026-07-06T22:07:26.271331Z","submitted_at":"2025-08-04T11:33:04Z","title":"VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo","version":3},"cited_work":{"arxiv_id":"2508.02317","doi":"10.48550/arxiv.2508.02317","metadata_source":"pith","pith_arxiv_id":"2508.02317","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Veomni: Scaling any modality model training with model-centric distributed recipe zoo","venue":"cs.CL","work_id":"98e8be4a-3e49-42c6-a20b-0106ca5b2488","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2508.02317","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:c199d0594c18e1e9656e0a0e950a20edd53c9f545a15ca07656ab5759f765e2c","observation_id":"ac20d748-c33d-41c6-9a5d-7819811d8066","resolution":{"observed_at":"2026-05-14T18:53:21.089942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Octopack: Instruction tuning code large language models","venue":null,"work_id":"52c0dff1-e314-485d-9b9c-5c688eea4f8e","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:c144ca84e68168972a99d7ba44f1321eb4d89eae83078acbc24482d68bab9b4c","observation_id":"55af2bc7-272d-4e58-8e59-3e64ae8eb8fa","resolution":{"observed_at":"2026-05-14T18:53:21.204555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:17.346874Z","title":"Jinjie Ni, Qian Liu, Chao Du, Longxu Dou, Hang Yan, Zili Wang, Tianyu Pang, and Michael Qizhe Shieh","venue":null,"work_id":"d8cbe1e4-e168-4295-9129-c5c84882ff5b","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:61b6b40fb500c0d090cbafab58feff0b0b471007589d0f3a5559f15af2313719","observation_id":"11ed8c08-a3a7-45c8-b016-92c849699431","resolution":{"observed_at":"2026-05-14T18:53:21.109804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-07-06T21:13:09.093282Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:997dc1824f052ac0db22eca3f6a431753fa691eedf38bac67d0ec69cda1889c5","observation_id":"cbac3c2e-1c69-46f2-8286-5d56524584fb","resolution":{"observed_at":"2026-05-14T18:53:21.116805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-02T00:06:16.208560Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":"1806.03822","doi":"10.48550/arxiv.1806.03822","metadata_source":"pith","pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","venue":"cs.CL","work_id":"0d268f3a-4ca4-4600-b238-9d35f0b3f691","year":2018},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:0dfa86a1f957cdfd788e24bfb5c4ad8117cd9db4cd135dcc2b0b4adb9616a2e1","observation_id":"30f2828c-9bb1-4d34-ae48-604b59572902","resolution":{"observed_at":"2026-05-14T18:53:21.123067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11774","last_updated":"2025-05-17T00:52:49Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-17T00:52:49Z","title":"HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class","version":1},"cited_work":{"arxiv_id":"2505.11774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11774","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hardmath2: A benchmark for applied mathematics built by students as part of a graduate class.arXiv:2505.11774","venue":null,"work_id":"2b05b9c2-f919-4104-ab43-352a191362f0","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2505.11774","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:b2c6ad4c820b6005274c70a4170d55d7e882175340ac196e670b40c5d4a5110f","observation_id":"0fab5f04-a82f-40c2-9da8-cb6f9615a8ea","resolution":{"observed_at":"2026-05-14T18:53:21.129675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-07-06T13:59:15.998573Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":"2210.01240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-07-10T09:37:00.809818Z","title":"arXiv preprint arXiv:2210.01240 , year=","venue":"cs.CL","work_id":"ec643dee-886e-4ede-bc9d-bc244c397d0a","year":2022},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:6d932955f7ba0f7fffb868405890f124dcb32a7c1be4148c81861453d5f4a0fb","observation_id":"32036520-a8b9-4ecf-9ddc-805c3a57c877","resolution":{"observed_at":"2026-05-14T18:53:21.136422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:408dc7a200b9bea32d3ad9daad4d85e5b24ce26822c4577942ccd54dc257fb8e","observation_id":"f53ddb95-1051-4d94-b6ae-45afbc26323b","resolution":{"observed_at":"2026-05-14T18:53:21.141813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16049","last_updated":"2024-03-23T21:21:44Z","snapshot_observed_at":"2026-08-04T21:08:49.454029Z","submitted_at":"2023-10-24T17:59:20Z","title":"MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning","version":2},"cited_work":{"arxiv_id":"2310.16049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.16049","snapshot_observed_at":"2026-07-03T14:28:31.206071Z","title":"Mirac Suzgun, Nathan Scales, Nathanael Sch¨arli, Sebastian Gehrmann, Yi Tay, Hyung Won Chung, Aakanksha Chowdhery, Quoc V Le, Ed H Chi, Denny Zhou, , and Jason Wei","venue":null,"work_id":"07c6d656-acea-4b1c-a918-d3410e88d8b6","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2310.16049","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:2906b723bcc4c5c5e6cab220d88ab72818cad3a1abbb18927dabbe265ccc5b27","observation_id":"059dcfff-2c7c-4537-a201-129f51d4bf9a","resolution":{"observed_at":"2026-05-14T18:53:21.147548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenging big-bench tasks and whether chain-of- thought can solve them","venue":null,"work_id":"2916fb49-78e3-4295-b1d3-50c495362dc6","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:2b3838bc8631b0fcb0e70ce76b5c654cc810b1ba70da5f13211ff3d1dd96aa9e","observation_id":"4665d315-c344-4dec-b222-c1f94c848332","resolution":{"observed_at":"2026-05-14T18:53:21.208803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-07-06T22:01:44.832937Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:318d81ff9fba88197ed69a8d3140e7b16e83208b3b360db7d560ca5905ff6f00","observation_id":"28d0e392-e39a-4e9d-97eb-ce31a2ebb1e0","resolution":{"observed_at":"2026-05-14T18:53:21.153791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09541","last_updated":"2026-04-14T23:15:20Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T16:52:25Z","title":"SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2510.09541","doi":"10.48550/arxiv.2510.09541","metadata_source":"pith","pith_arxiv_id":"2510.09541","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models","venue":"cs.CL","work_id":"366411af-e093-43e9-b2d8-50fddef593a5","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2510.09541","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:d15fc901791ff0accaa315f4c92b4a955165f4e3ca81ac9662c9862f2971c455","observation_id":"93eaa01e-8b08-42b9-9859-d92bd0278fc1","resolution":{"observed_at":"2026-05-14T18:53:21.160063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09192","last_updated":"2025-08-08T04:51:37Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-08T04:51:37Z","title":"Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing","version":1},"cited_work":{"arxiv_id":"2508.09192","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09192","snapshot_observed_at":"2026-07-11T03:07:51.302542Z","title":"Diffusion llms can do faster-than-ar inference via dis- crete diffusion forcing.arXiv preprint arXiv:2508.09192","venue":"cs.LG","work_id":"3fd87c40-91ee-403b-9781-58b4e2feb625","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2508.09192","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:24a6b7da6bb0a279fac2f8ad6c8c6a33b7528466c31cc974832e6dee50093929","observation_id":"80cb5910-dc98-4708-bbaf-9054fa671408","resolution":{"observed_at":"2026-05-14T18:53:21.165818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16636","last_updated":"2023-06-29T02:19:50Z","snapshot_observed_at":"2026-07-06T15:48:05.491179Z","submitted_at":"2023-06-29T02:19:50Z","title":"CMATH: Can Your Language Model Pass Chinese Elementary School Math Test?","version":1},"cited_work":{"arxiv_id":"2306.16636","doi":"10.48550/arxiv.2306.16636","metadata_source":"pith","pith_arxiv_id":"2306.16636","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/ 10.48550/arXiv.2306.16636, http://arxiv.org/abs/2306.16636, arXiv:2306.16636 [cs]","venue":"cs.CL","work_id":"be5573ad-c858-4ffb-bbb1-e7d6ac22592c","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2306.16636","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:aaa6ffabd9e3ebe23c5f63ad9bc8a58afec03b57237d424a090bd078bf7b8942","observation_id":"123145a3-4d7b-4b96-88bd-235af4a73839","resolution":{"observed_at":"2026-05-14T18:53:21.171866Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:18.823856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:18.823856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01142","last_updated":"2025-09-01T05:30:56Z","snapshot_observed_at":"2026-08-05T09:56:06.479435Z","submitted_at":"2025-09-01T05:30:56Z","title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","version":1},"cited_work":{"arxiv_id":"2509.01142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01142","snapshot_observed_at":"2026-07-11T03:07:52.385541Z","title":"Dream-coder 7b: An open diffusion language model for code.arXiv preprint arXiv:2509.01142","venue":"cs.CL","work_id":"8a7c9708-6012-4156-8cca-f10969908d10","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2509.01142","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:de94efbab9622a7c7254b9d59d41f1eb207ce7b72a6ffa5c59bcd79d942d52a3","observation_id":"8efbabca-7789-41fe-ad2a-a786d877a9f7","resolution":{"observed_at":"2026-05-14T18:53:21.177892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.15487","doi":"10.48550/arxiv.2508.15487","metadata_source":"pith","pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream 7B: Diffusion Large Language Models","venue":"cs.CL","work_id":"a8a49dbd-ad10-4c79-b1aa-3ad5173887ad","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:be692becb5b2059b743443098607652ad5da3d77de4a5ec4864e5b0aae896f2c","observation_id":"d029ee52-688d-47af-b8f5-6a61a009a474","resolution":{"observed_at":"2026-05-14T18:53:21.183283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.13759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T17:35:51.719402Z","title":"Discrete diffusion in large language and multimodal models: A survey","venue":null,"work_id":"58bdb31e-9c01-4d67-bf4e-bae971b88a56","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:a9f625f51e83ddccc01b6dcdd7c1b5719da5b3f5a46f4d9d3c027267f6a497a9","observation_id":"98fc4c30-09b2-475e-9f49-216c4eaaa1b7","resolution":{"observed_at":"2026-05-14T18:53:21.189267Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:047cdcf922b7b741637ed8d0fd38c20ddd859d6c5c984031818f4d20467e5241","observation_id":"648685a0-f329-4c85-b95c-ccb87d6dc540","resolution":{"observed_at":"2026-05-14T18:53:21.194371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-02T10:07:31.047425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":"2305.12474","doi":"10.48550/arxiv.2305.12474","metadata_source":"pith","pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","venue":"cs.CL","work_id":"2eacfa63-8867-4a90-9bcc-52f085f33cef","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:14ae089fcc4770ed114229946c4f1039ef2ed2effad6c5363fd89518c7804145","observation_id":"ea268b62-2206-4296-8766-bdf9dc750395","resolution":{"observed_at":"2026-05-17T12:28:32.509177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:e5c2b0ded1e8cd90be5fa1fffc3447ad37c538b0e9d47b51c5aca82a05a886a3","observation_id":"95fe5f4d-9b50-43ee-bf5a-7f36e1ad2933","resolution":{"observed_at":"2026-05-14T18:53:21.096111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":"2406.15877","doi":"10.48550/arxiv.2406.15877","metadata_source":"pith","pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","venue":"cs.SE","work_id":"14715c3c-002c-4bc4-8882-f7c586954d62","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:a70fd5d33c11e73b0b0fe267c2e83061d9beb0193ea92658f068eee5ecdfdca6","observation_id":"cc9255bb-b89a-447f-84f4-c47a579f855e","resolution":{"observed_at":"2026-05-14T19:30:10.582609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 81 inbound Pith citation observations for arXiv:2512.15745."}