{"as_of":"2026-08-12T04:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87a551bfc44b1145c60197db54acc764d9301bca68ea7add849a068b38ad89cc","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:14:52.259504Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06628/citation-record","integrity":"/paper/2608.06628/integrity","json":"/paper/2608.06628/citation-record.json","paper":"/paper/2608.06628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.215311Z","title":"LLaDA2.1: Speeding up text diffusion via token editing.arXiv preprint arXiv:2602.08676,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.215311Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:ff29143a060a08ce669c64c17d3f30203f1447b3b90a7f4be0514c16f853ebbd","observation_id":"b5a2cd5a-19a3-4a67-9705-f5aaf2f93008","resolution":{"observed_at":"2026-08-10T04:14:52.215311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-10T04:14:52.227519Z","title":"T ¨ULU 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.227519Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:7886955963a535369c233166e564a85f8a1ad2ce19f2928ce802ad841587180d","observation_id":"a3bd89b5-400f-4c24-ae2a-c637e226a8f3","resolution":{"observed_at":"2026-08-10T04:14:52.227519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.234749Z","title":"The diffusion duality.arXiv preprint arXiv:2506.10892,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.234749Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:e38aa82bc6748ba9f71b4f484d419182759a16ca6789a2381314af8e3554b8b6","observation_id":"f2c19505-7d58-4ab0-8f26-18f9c71be134","resolution":{"observed_at":"2026-08-10T04:14:52.234749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:53.427564Z","title":"Simple guidance mechanisms for discrete diffusion models","venue":null,"work_id":"21423453-8fcd-4535-870b-64d3b91d9074","year":2025},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.237955Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:11a9263b30330742eab169709136f3496c24752b03ec100d8d1eaca66f6ee1a1","observation_id":"23b64969-f29e-4ae8-bee2-6ee729f11043","resolution":{"observed_at":"2026-08-10T04:14:53.431302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-07-06T22:07:21.387432Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-10T04:14:52.241127Z","title":"Seed diffusion: A large-scale diffusion language model with high-speed inference.arXiv preprint arXiv:2508.02193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.241127Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:bfbf88aeb7cde2e875a27290b660f9f386dc12ff486e2c63d1a0e472aa575a1d","observation_id":"45fde0ac-3bb3-45ff-9b5a-00564e33aa02","resolution":{"observed_at":"2026-08-10T04:14:52.241127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.852623Z","title":"Discrete diffusion models exploit asymmetry to solve lookahead planning tasks.arXiv preprint arXiv:2602.19980,","venue":null,"work_id":"96a691a4-80c2-43f9-837e-fbe8f5968aaf","year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.244505Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:a6bb1a975df2269a9e3582ed63044df44f6d0d9354ce31ae934ba7ad34dff40b","observation_id":"75a91339-753f-4b2c-ade5-355164e84f6f","resolution":{"observed_at":"2026-08-10T04:14:52.860526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14157","last_updated":"2025-02-18T03:52:31Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T03:48:53Z","title":"Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14157","snapshot_observed_at":"2026-08-10T04:14:52.251220Z","title":"Beyond autoregression: Discrete diffusion for complex reasoning and planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.251220Z"},"links":{"cited_paper":"/paper/2410.14157","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:388887e0fd1cadce7460bc70ee49fcd3014f06de3db690442a43cd0d9a8df1b8","observation_id":"b661e5b2-1b26-4a38-8fd4-2207cde2dd89","resolution":{"observed_at":"2026-08-10T04:14:52.251220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-10T04:14:52.255473Z","title":"Dream 7B: Diffusion large language models.arXiv preprint arXiv:2508.15487,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.255473Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:0c376d5dc9c0dbd67532cc43b5c0f04103ca43baeba3f7f2f03db3cfe81a8f4d","observation_id":"dd92681b-0e94-4a2c-b337-b9e4a095f30a","resolution":{"observed_at":"2026-08-10T04:14:52.255473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.259504Z","title":"LLaDA-MoE: A sparse MoE diffusion language model.arXiv preprint arXiv:2509.24389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.259504Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:ac817306cc53520aa6e3263950aececad273bc6f95c9d745298f36af15c99d85","observation_id":"f6e50143-e983-4ddc-aab8-923000149b22","resolution":{"observed_at":"2026-08-10T04:14:52.259504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06768","last_updated":"2025-08-19T23:35:57Z","snapshot_observed_at":"2026-08-09T09:47:58.662011Z","submitted_at":"2025-02-10T18:47:21Z","title":"Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06768","snapshot_observed_at":"2026-08-10T04:14:52.223396Z","title":"Train for the worst, plan for the best: Understanding token ordering in masked diffusions.arXiv preprint arXiv:2502.06768,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.223396Z"},"links":{"cited_paper":"/paper/2502.06768","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:55631aaafc1512be14e060ff4cd4dec4e8fc0017d3e026dfcf075cd26bad4f87","observation_id":"b4fc0e3f-e488-4920-94dc-c5359c886ca1","resolution":{"observed_at":"2026-08-10T04:14:52.223396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-10T04:14:52.219401Z","title":"Mercury: Ultra-fast language models based on diffu- sion.arXiv preprint arXiv:2506.17298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.219401Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:1dec8560fc0be641c5cd9edb8f75ba349bd05ec74826db5ddfa6e7f106fb6a05","observation_id":"57eac887-b242-4466-82b9-7facf6251a04","resolution":{"observed_at":"2026-08-10T04:14:52.219401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:53.202149Z","title":null,"venue":null,"work_id":"af17782a-c869-4762-b24e-7d5079065733","year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.231187Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:73797f23f550a95c7e3c451d0dd6a9ac11ce1dbd883ad9ef58704ce203b1cda4","observation_id":"4116384a-676a-4adb-beea-c56fef673046","resolution":{"observed_at":"2026-08-10T04:14:53.207417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-10T04:14:52.210581Z","title":"Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.210581Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:d70a99bb6555431bc4fa2f36e9e2f6ca4a6211285e806773ae92f6af1667485b","observation_id":"005303c5-fdda-42e1-911d-718910c9471c","resolution":{"observed_at":"2026-08-10T04:14:52.210581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.247619Z","title":"Scaling behavior of discrete diffusion language models.arXiv preprint arXiv:2512.10858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.247619Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:85b970688613c86b4554282daa57b90e0fcbfe8bb17b117aedf6d9ac7cd8a3a9","observation_id":"0b87d0c0-a694-4142-bb9f-d2dfbc6d6f56","resolution":{"observed_at":"2026-08-10T04:14:52.247619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T04:10:01.853688Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.06628."}