{"as_of":"2026-08-10T11:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bbb1a90c4cd8e5cf7d6eb102052246999cc56df88ba6bb625a3c2cecc309ad3","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:06.681448Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:15:16.805001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:46:14.278414Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-05T20:15:16.805001Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:16.805001Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:a59e4f7859e3cf43ae2a5f76b778c1d3fc61b018df8125da2faecccbec551683","observation_id":"5512026d-d41a-443f-ade3-0fabd8784bef","resolution":{"observed_at":"2026-08-05T20:15:16.805001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-05T13:20:05.355680Z","title":"Anchored diffusion language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01025","last_updated":"2025-09-07T22:48:13Z","snapshot_observed_at":"2026-08-06T04:06:34.224683Z","submitted_at":"2025-08-31T23:34:53Z","title":"Any-Order Flexible Length Masked Diffusion","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:20:05.355680Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2509.01025"},"observation_digest":"sha256:9300e9577f3e963dcf00082da8ec9583ba70026a7913fefef0aa1b9e45ec5bde","observation_id":"76a6718c-3712-4070-94ae-99d94950cdb0","resolution":{"observed_at":"2026-08-05T13:20:05.355680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-04T13:15:31.739567Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01384","last_updated":"2026-05-22T19:48:31Z","snapshot_observed_at":"2026-08-09T16:34:10.718069Z","submitted_at":"2025-10-01T19:15:25Z","title":"Fine-Tuning Masked Diffusion for Provable Self-Correction","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:31.739567Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2510.01384"},"observation_digest":"sha256:d5c14754e3a0cbeb9697ebc5feb80734adf38dac9be7ac3158cb3ebd484ecad6","observation_id":"98138791-d3ff-4bb0-9903-83f93e5f0495","resolution":{"observed_at":"2026-08-04T13:15:31.739567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2505.18456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-07-01T20:46:14.278414Z","title":"Anchored diffu- sion language model.arXiv preprint arXiv:2505.18456","venue":null,"work_id":"ef21e3d3-47f3-4d30-804b-0b7dfcf24b06","year":2025},"citing_paper":{"arxiv_id":"2602.16169","last_updated":"2026-05-20T20:41:06Z","snapshot_observed_at":"2026-07-06T22:46:17.123722Z","submitted_at":"2026-02-18T04:05:40Z","title":"Discrete Stochastic Localization for Non-autoregressive Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T11:36:24.506077Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2602.16169"},"observation_digest":"sha256:e5629ab9b89a62979e13779522ec1fea38d8e46b3dc668a0964f80d78f4056b5","observation_id":"710b71cf-b638-4670-a564-36bfa08915ac","resolution":{"observed_at":"2026-05-22T11:36:28.954199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2505.18456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-07-01T20:46:14.278414Z","title":"Anchored diffu- sion language model.arXiv preprint arXiv:2505.18456","venue":null,"work_id":"ef21e3d3-47f3-4d30-804b-0b7dfcf24b06","year":2025},"citing_paper":{"arxiv_id":"2605.12836","last_updated":"2026-05-20T20:19:39Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-13T00:12:24Z","title":"Discrete Stochastic Localization for Non-autoregressive Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:45:54.863655Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2605.12836"},"observation_digest":"sha256:f4d4dfb4bb080f4e7b7e50ede1fb9b0635d566522c03ccc58bef4ac53bf438b8","observation_id":"5d124acd-12a4-473e-b721-cbdfd00e0c33","resolution":{"observed_at":"2026-05-14T20:47:58.428582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2505.18456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-07-01T20:46:14.278414Z","title":"Anchored diffu- sion language model.arXiv preprint arXiv:2505.18456","venue":null,"work_id":"ef21e3d3-47f3-4d30-804b-0b7dfcf24b06","year":2025},"citing_paper":{"arxiv_id":"2606.01024","last_updated":"2026-05-31T05:27:01Z","snapshot_observed_at":"2026-08-06T19:38:02.696107Z","submitted_at":"2026-05-31T05:27:01Z","title":"DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T17:39:11.170970Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2606.01024"},"observation_digest":"sha256:13a3ad88a6333e3d275c0319b3772459e3b78d1b609d1e8ff2eb3df070902b09","observation_id":"0e4092a3-c70b-4d7b-b303-7781e75e1e54","resolution":{"observed_at":"2026-07-01T20:46:14.279785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-01T14:25:40.569444Z","title":"arXiv preprint arXiv:2505.18456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26504","last_updated":"2026-07-29T06:09:12Z","snapshot_observed_at":"2026-08-06T23:53:20.383703Z","submitted_at":"2026-07-29T06:09:12Z","title":"From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T14:25:40.569444Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2607.26504"},"observation_digest":"sha256:2a7ca372d24c029183fe1d281b0342914387c2cb8db1f3079af1ec8db6e2c6ef","observation_id":"3ebc75e4-5bf4-488f-b59e-58850309c538","resolution":{"observed_at":"2026-08-01T14:25:40.569444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18456/citation-record","integrity":"/paper/2505.18456/integrity","json":"/paper/2505.18456/citation-record.json","paper":"/paper/2505.18456"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.777378Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"9760bba9-f34d-46e0-8021-893fedb58b69","year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:58.965039Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:c55a22938f06fdba408ae52703afb964a095f9a88f64a8aa0bf1abb573ecbe45","observation_id":"8ce6cb26-551e-455f-a5d5-49119d6a7ef7","resolution":{"observed_at":"2026-08-07T14:39:13.879220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:59.036768Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.036768Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:3272c6453a09866cfce64d6e550317dc5b38ee1c3448e9030ebad6915d4bde60","observation_id":"b1bb3506-e19b-4d4d-8151-510d0fa0130a","resolution":{"observed_at":"2026-08-07T14:38:59.036768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.489087Z","title":"Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg","venue":null,"work_id":"b293d88a-4171-48eb-8bc5-3511bb115edf","year":2021},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.167895Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:c41faba4ee1ec12a327e675996c2903e36023cce53420c186c25875bb73901a3","observation_id":"ff08b4e7-0388-41cc-91b2-1200997783c2","resolution":{"observed_at":"2026-08-07T14:39:13.631420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.241844Z","title":"A neural probabilistic language model","venue":null,"work_id":"516a5320-ca64-413c-afc6-950d2e0996b9","year":2003},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.283765Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2b1298ce5fb1b84bd31d54d9aa2b377a0a703e53c3511d672385cdbee551830b","observation_id":"cc57b84e-24e3-40ea-8834-ebc3b7ff25b9","resolution":{"observed_at":"2026-08-07T14:39:13.360816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.010764Z","title":"Language models are few-shot learners","venue":null,"work_id":"3fef2521-8a24-4321-8459-cb7ebc064c60","year":1901},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.384307Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ef196eb96b41a973ac3b220abde42c186f64dc87427f5f34053c6dc3777050ef","observation_id":"81891a66-8540-45eb-b175-327041b1a0b2","resolution":{"observed_at":"2026-08-07T14:39:13.094828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.770234Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"89d4338d-a3fa-4df7-a814-3a85b2c54ed3","year":1901},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.491670Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:17f0c6d50ba7333ac7a18ca986175b8d0cfdeb21575b4977259a7f7a8f9d241d","observation_id":"35e57478-4f96-48e0-aac6-7f9a88f8fd39","resolution":{"observed_at":"2026-08-07T14:39:12.874152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.546439Z","title":"A continuous time framework for discrete denoising models","venue":null,"work_id":"380571fb-dc1e-4e8b-a06e-c39c82aca373","year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.603802Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:11907cb8f2c8d6407282ac096f82fa39b909d542a44067a40a4808840d031cf6","observation_id":"8af44e27-6b6c-4645-9299-16e0d75906aa","resolution":{"observed_at":"2026-08-07T14:39:12.661708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.3005","last_updated":"2014-03-04T18:30:26Z","snapshot_observed_at":"2026-08-05T11:04:54.095339Z","submitted_at":"2013-12-11T00:25:57Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.3005","snapshot_observed_at":"2026-08-07T14:38:59.750300Z","title":"One billion word benchmark for measuring progress in statistical language modeling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.750300Z"},"links":{"cited_paper":"/paper/1312.3005","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:369c61395d32b8be0740b78ba42dba4980fabbd7d5194e0556b26b7f9d6510d0","observation_id":"8f049e08-84ba-4c18-815c-bb1dca98347f","resolution":{"observed_at":"2026-08-07T14:38:59.750300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.303883Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":"7a10dcc4-b64f-46d4-b387-0d1375be0f9a","year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.864579Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:9ff3faea5d3f9fcce2e107fa1069ffa5c7d0e80c72f2caa91a604327054917df","observation_id":"037a33cf-2f88-4974-8bc1-e460bc001008","resolution":{"observed_at":"2026-08-07T14:39:12.408545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:38:59.998900Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.998900Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:57a03e4c4e38071a3e72a7fe705ef03ee012b8e813a8b3f880f76d57f6924cd1","observation_id":"fa02e8c1-7dd9-44fd-96e4-55f0f141745b","resolution":{"observed_at":"2026-08-07T14:38:59.998900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.041520Z","title":"A discourse-aware attention model for abstractive summarization of long documents","venue":null,"work_id":"405f1d21-90fd-4542-a31d-9be86c939bce","year":2018},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.130743Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:4efc25be84b690648245c3020a208ae1fec6ab928752a9450151cb5176ac96e9","observation_id":"06f5ca7c-9c2b-4507-ac30-4667e36e161d","resolution":{"observed_at":"2026-08-07T14:39:12.158053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.737127Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":"8e519862-9e0a-43a6-b0ce-786e71bedf67","year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.263743Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:71fcfde067872c8affced5a1b132a38ff918679376353ddfd431fa405992cb40","observation_id":"8f4ccba6-6bec-4dbc-a250-3aa4af905e41","resolution":{"observed_at":"2026-08-07T14:39:11.891851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:00.380299Z","title":"Maximum likelihood from incomplete data via the em algorithm","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.380299Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2959e855db351c27b23924bdbce58ef886813e48ac5bc790e379c6354c4e512b","observation_id":"0c433977-63d8-4822-a18b-ff12c195ed25","resolution":{"observed_at":"2026-08-07T14:39:00.380299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-07T14:39:00.510403Z","title":"From explicit cot to implicit cot: Learning to internalize cot step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.510403Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e73b5a8b4267f5df3921d1a37d61891984de15e3845ca3077134dd7ea66526fd","observation_id":"8af0f5d5-6d4a-4931-8ef2-6e2bed1b5294","resolution":{"observed_at":"2026-08-07T14:39:00.510403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:00.638726Z","title":"Hierarchical neural story generation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.638726Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:dbc2ea508f90c125361d16834f06669808e16f2f9b2efafec6687b31159e2cb7","observation_id":"17de1736-4bef-409e-89ab-df0d31db9acf","resolution":{"observed_at":"2026-08-07T14:39:00.638726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.506698Z","title":null,"venue":null,"work_id":"c28a50e1-b335-41f5-af33-3c55ab379572","year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.745092Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:fbd9d967f08e4994dd2d1cadb28799b92319b16de9143620d096092b3c4d758a","observation_id":"76fb7c70-f37e-4c06-b2ae-96f846c8e646","resolution":{"observed_at":"2026-08-07T14:39:11.608600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:00.928402Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.928402Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:67a8aa98b796633d1024b96d94f1b8d55cfde4472dbd1603676f424109bfb5cb","observation_id":"3d5c6c26-b2cb-49da-af73-d0185d91a937","resolution":{"observed_at":"2026-08-07T14:39:00.928402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.064162Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.064162Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:8e7e5f9f4b124a0eeabf4e76831b4b6f60f58d417b4c4f3d4bfac9e73c205a82","observation_id":"fe14b957-2fdf-4166-b4dc-c4a87108df83","resolution":{"observed_at":"2026-08-07T14:39:01.064162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.196440Z","title":"Likelihood-based diffusion language models","venue":null,"work_id":"738a6d1f-c0cd-48fc-bd86-5c2e1d9b9f19","year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.168780Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:5db07c26a3e340721db0af2826740f027a054a9102cf3a661827e47887edbcdf","observation_id":"3e279421-604b-4a84-b640-52d5354052e1","resolution":{"observed_at":"2026-08-07T14:39:11.339861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-07T14:39:01.306376Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.306376Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:db9d0bade8362a3aaaf3d36e03c93441e9488f2b24e4cef594665a6cd61bdfa4","observation_id":"81097abb-f2f3-4b0a-9020-67de277c70b2","resolution":{"observed_at":"2026-08-07T14:39:01.306376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.895031Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":"1188a1ab-5ee7-4375-b0f0-be298701ef9c","year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.439447Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:c94812ddbb7c03d6a2ff5341c0af02b381f66fb2e54e10ec94645f22aef5920b","observation_id":"c8c17fe8-e82b-466b-8c11-1b357b0453a6","resolution":{"observed_at":"2026-08-07T14:39:11.025766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.535721Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.535721Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e233abf4695251548ed015f128d5fbb84bdff07189677e2e220d3136ec967393","observation_id":"d7038d43-b11b-4815-bcf0-f3694ec56bea","resolution":{"observed_at":"2026-08-07T14:39:01.535721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.669653Z","title":"Interpolated estimation of markov source parameters from sparse data","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.669653Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2eb3d2278c4f450fba50ab328e8db6ecf2c25ad8715db85caffc08d0201efa1a","observation_id":"c2c09ced-eb9e-42cf-af79-e005c83c2df8","resolution":{"observed_at":"2026-08-07T14:39:01.669653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.838190Z","title":"An introduction to variational methods for graphical models","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.838190Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:d08ba0659b889a5dbc03f71acbfa0fd68c9c85fa6746390b917086dea012d4b6","observation_id":"2e5e736b-6781-45fd-9021-bda6475a412d","resolution":{"observed_at":"2026-08-07T14:39:01.838190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.958228Z","title":"Generalization through memorization: Nearest neighbor language models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.958228Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:574d986d6faac5a7c69ad77783c322c5b07f49773b3065ffb9f0d2d32163c7a4","observation_id":"34f21089-e3fc-4115-b4b6-f8eb4f407f9d","resolution":{"observed_at":"2026-08-07T14:39:01.958228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.526541Z","title":"Probabilistic graphical models: principles and techniques","venue":null,"work_id":"baed4641-afde-47aa-9f30-0ce65c6f89d4","year":2009},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.068479Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:58ebef586d1bcf982a902c26b866197ad26aaea93d2f3479455a6bf9087646dc","observation_id":"eff69f4d-420c-427a-993d-7eaace310741","resolution":{"observed_at":"2026-08-07T14:39:10.657618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:02.207206Z","title":"Global optimality of the em algorithm for mixtures of two-component linear regressions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.207206Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:df84e5dc5e657bc90d51d42599e78332e0be8d08cc470b0ff0701328c51bfbb6","observation_id":"e18d0ff5-e2d8-463a-8ee1-c23d5b75cec7","resolution":{"observed_at":"2026-08-07T14:39:02.207206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.322920Z","title":"Visualizing and understanding neural models in nlp","venue":null,"work_id":"c4c6b4dd-f0ed-4553-b7d3-ed2641017199","year":2016},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.347477Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:8dbbf1eb13620539465bc42f9bf70e71d761429be62dd382c743647e9cee6211","observation_id":"6f351d66-6edc-4ed1-8017-160b1b2aa5c3","resolution":{"observed_at":"2026-08-07T14:39:10.434128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.070977Z","title":"Diffusion- LM improves controllable text generation","venue":null,"work_id":"8544ec78-3430-4215-98a8-ddd40a148f6e","year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.447565Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2e2ce3d25fec56aab05a38c7e2bc349a93562e57e48aebe391e84f4c1487742d","observation_id":"b0bc1f4f-b1ad-4f5b-9e33-62babb78f3f7","resolution":{"observed_at":"2026-08-07T14:39:10.196642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.857992Z","title":"Diffusion- LM improves controllable text generation","venue":null,"work_id":"74b69c2e-f484-4627-98da-892aa41427aa","year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.569141Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:91e6167e987e38f685f9d37851b695f00a7f6e66bb101a51f9d84d6592bdc28a","observation_id":"8c10c74b-be92-47fa-abfe-0ac42a4c9758","resolution":{"observed_at":"2026-08-07T14:39:09.969440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:02.677502Z","title":"Assessing the ability of LSTM s to learn syntax-sensitive dependencies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.677502Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:93305d0bfa65e16581822dbb4f9dc96b147e64e72e3c1c512528f5c926c280ce","observation_id":"f2482a7c-2923-4974-8a9b-db309645ec85","resolution":{"observed_at":"2026-08-07T14:39:02.677502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.666585Z","title":"Think while you generate: Discrete diffusion with planned denoising","venue":null,"work_id":"832bf358-0f00-44ef-9abe-e5c12bf2a0ea","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.771744Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:7f6dfd6b511a9082a40e2f1b7277009a2d2c0fff362c42b70ee343a76e487640","observation_id":"6b6841c5-c06a-4b31-b4db-993a146c71a6","resolution":{"observed_at":"2026-08-07T14:39:09.746665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:02.946694Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.946694Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:01d0cb3a33b59add043fb1bfcb4f0ddfab2a28ab5a830860142d9ee8b7ded1fc","observation_id":"7f73c345-9412-4e2d-a716-d670484af5a6","resolution":{"observed_at":"2026-08-07T14:39:02.946694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:03.045391Z","title":"Building a large annotated corpus of english: The penn treebank","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.045391Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ea2e6928d0ddb9bed58238b6e0393db3464ce90f0e4043e45f1f47eeb5b7f71a","observation_id":"aa7e6ecf-d4cf-4448-a776-8d65fdc1da8d","resolution":{"observed_at":"2026-08-07T14:39:03.045391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:03.144178Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.144178Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:7cf134002f321c4158e7391e056a77ed8736ba42b198aeb18d2b501fc9bc3aa7","observation_id":"2736cb81-4fe8-4890-b218-59b68f90631b","resolution":{"observed_at":"2026-08-07T14:39:03.144178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.340489Z","title":"A view of the em algorithm that justifies incremental, sparse, and other variants","venue":null,"work_id":"c3001e92-b504-495f-bab2-6c60c284654f","year":1998},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.276776Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:98bb5dee1576b78d2d26b039d3bddfb8a0d48eb41a8dd4e006337abda8c1e38a","observation_id":"ee196ebe-5ce9-4170-905b-7b07569b7f71","resolution":{"observed_at":"2026-08-07T14:39:09.461268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.030520Z","title":"Scaling up masked diffusion models on text","venue":null,"work_id":"d53b73a3-a171-4869-864e-e8046a5ceb81","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.445119Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:108a53ebc49e858c553ae796ce4edf891566c28640daae79a2a7393d2603ef60","observation_id":"b62f61ea-352b-4877-9944-e8392f11765a","resolution":{"observed_at":"2026-08-07T14:39:09.169622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-07T14:39:03.552580Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.552580Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:1cdecb3b3d3b93b642d3039ccb9238018826481329ec436c0a35ba0f5eff92dd","observation_id":"577880ad-df62-4238-a96f-b95136a3bd9c","resolution":{"observed_at":"2026-08-07T14:39:03.552580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.815125Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data","venue":null,"work_id":"fe7bd757-b321-4566-b530-61870454ebdb","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.689052Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:8cc57bee24a8e18a05957a9193888c073a691000024166c5c5b630da839d1407","observation_id":"7680496e-5f4d-4d5d-aacb-0bf7e735aadd","resolution":{"observed_at":"2026-08-07T14:39:08.917469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.562161Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"b181fb55-3d76-40d8-848c-7cf664f1bcaa","year":2016},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.754863Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:a09f0f72c5f38c1c0b6f4d258e6f87150770d0aa4c37d433ef31a3b817a6c92e","observation_id":"9b78781d-9349-46ae-bce6-c001adcef62f","resolution":{"observed_at":"2026-08-07T14:39:08.679059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:03.891906Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.891906Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:55364e46e941934705077cfcd2650457e565362550e7fdca51cbb13accc5f62e","observation_id":"0383c29c-9de2-4043-987b-4abcc129ee00","resolution":{"observed_at":"2026-08-07T14:39:03.891906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.301506Z","title":"MAUVE : Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"8401cc48-aba6-4456-bbf7-e55b7ff7d89f","year":2021},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.977371Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:6d32542d4a4e28f07458ea44a2602bf0b05c080c5e1a6c1edb9652cf6a78d83d","observation_id":"fd292724-2db5-482f-af43-3364a677df73","resolution":{"observed_at":"2026-08-07T14:39:08.411901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.119170Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.119170Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:fc543043943d6d38633a58f9a6dca2dd686e403a589c6435d8f17ee74a3a542a","observation_id":"11ff892a-711c-45b1-b894-c001827e7cfd","resolution":{"observed_at":"2026-08-07T14:39:04.119170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.258465Z","title":"Reasoning to learn from latent thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.258465Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:6c821e48020be49bcb8e48f227dc2cccc44e846d21319b3a90d7d4c5b64803c9","observation_id":"8978d614-a598-42a6-bac7-83ff302481c8","resolution":{"observed_at":"2026-08-07T14:39:04.258465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.363724Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.363724Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:b375446808fb93229532f7e10ecdc49c9e783d8a31f36e76fdd191e68a0a321c","observation_id":"8e61fd0c-1dd6-4922-ab9a-390a94f8e4d9","resolution":{"observed_at":"2026-08-07T14:39:04.363724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.501098Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.501098Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:b88c13ebfd27a57a94b3ee078dab5d717b886459b8b921afee4a8008c6fa1c6a","observation_id":"c27fcd28-eb64-47d7-a8e6-c16b594a524a","resolution":{"observed_at":"2026-08-07T14:39:04.501098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21074","last_updated":"2025-09-23T08:16:08Z","snapshot_observed_at":"2026-08-07T17:46:47.440455Z","submitted_at":"2025-02-28T14:07:48Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21074","snapshot_observed_at":"2026-08-07T14:39:04.630297Z","title":"Codi: Compressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.630297Z"},"links":{"cited_paper":"/paper/2502.21074","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:3f39d6e8e3fa325a49346c2602eb4f7b71c094d08426074047774869ba660078","observation_id":"9d85ea14-51fc-4f58-8f3c-55d150be0204","resolution":{"observed_at":"2026-08-07T14:39:04.630297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.026429Z","title":"Simplified and generalized masked diffusion for discrete data","venue":null,"work_id":"211e9b55-c56a-463a-8cc4-7c576988f9cd","year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.749940Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:81376ce858366d9092c55f30f41424eb9bf85fbd396fe08e28c6664837a8e143","observation_id":"52797b49-6834-454f-90ce-4cbc17988167","resolution":{"observed_at":"2026-08-07T14:39:08.119929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.904696Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.904696Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:30c702e001e5885b0f23c64ee76919b4d9e4494f4fddc4b43f4fe8f440669afb","observation_id":"789076cb-57e4-4164-9f2f-b028fc30978f","resolution":{"observed_at":"2026-08-07T14:39:04.904696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:05.033943Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.033943Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:9bf155498bf3084609edb2f7a82454923adc64949fd0389530d9e2c255695ffd","observation_id":"b083c11b-c25a-4976-ad72-58da2ff4e6da","resolution":{"observed_at":"2026-08-07T14:39:05.033943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:05.162980Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.162980Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:474f9f6754497393bd3f053befa5a75336eb29a7e34b9a57974b25dfe07dcdad","observation_id":"f46065ab-0d67-417a-b070-80c721e3d288","resolution":{"observed_at":"2026-08-07T14:39:05.162980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:07.729771Z","title":"Omninet: Omnidirectional representations from transformers","venue":null,"work_id":"ed8f423f-2200-4dc1-993d-30370d130a53","year":2021},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.284703Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e3e276d9775e40b0a7ae3ecfc95766d6ec7321680ed08b86c136e76578ca82d3","observation_id":"0e1b0904-a9cd-48b1-be79-e270eb47cf16","resolution":{"observed_at":"2026-08-07T14:39:07.855647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:39:05.403656Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.403656Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:6c18bfbd31267b6e47322381847d5899c933922c84671630d58cb8b1a65153b2","observation_id":"013a91ac-1994-4a00-ab92-2784262482ec","resolution":{"observed_at":"2026-08-07T14:39:05.403656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:05.506507Z","title":"BERT rediscovers the classical NLP pipeline","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.506507Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:39c6088403a2523bea7b725047e4478f9819b650c9c243f1b9982b60ee86d4d6","observation_id":"f75ed19a-4e6c-489f-b379-66ccc26975cf","resolution":{"observed_at":"2026-08-07T14:39:05.506507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:39:05.666687Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.666687Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:a54c360408a03094529796f712efa243197b6cf42b30ffa142e661baae8826a3","observation_id":"d0bc9ceb-8d24-4520-b232-b4ad8704242a","resolution":{"observed_at":"2026-08-07T14:39:05.666687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:07.501789Z","title":"Glauber generative model: Discrete diffusion models via binary classification","venue":null,"work_id":"c7a02f08-eadc-40cb-a979-6ab2814445ad","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.799813Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:533275d86a23933cd86e91d3332b7f3983841fba6a3cdddcd8b0bf13c17696e2","observation_id":"85cc6d48-6334-4d71-b06e-37ebd5d0a678","resolution":{"observed_at":"2026-08-07T14:39:07.574901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04482","last_updated":"2025-06-09T14:23:45Z","snapshot_observed_at":"2026-08-07T17:24:35.915580Z","submitted_at":"2025-03-06T14:30:55Z","title":"Generalized Interpolating Discrete Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04482","snapshot_observed_at":"2026-08-07T14:39:05.956211Z","title":"u tte, Janis Fluri, Yuhui Ding, Antonio Orvieto, Bernhard Sch \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.956211Z"},"links":{"cited_paper":"/paper/2503.04482","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:f7d4e4b67142d3a55d9f09138bccb66534f66aa6c8e010d725529bcd584ec891","observation_id":"8dac312e-0a18-448f-9aef-879f82478e9d","resolution":{"observed_at":"2026-08-07T14:39:05.956211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04094","last_updated":"2019-04-09T18:01:28Z","snapshot_observed_at":"2026-08-06T22:51:14.869467Z","submitted_at":"2019-02-11T19:02:27Z","title":"BERT has a Mouth, and It Must Speak: BERT as a Markov Random Field Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04094","snapshot_observed_at":"2026-08-07T14:39:06.099849Z","title":"Bert has a mouth, and it must speak: Bert as a markov random field language model","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.099849Z"},"links":{"cited_paper":"/paper/1902.04094","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ec81cf3c7c7e94bf85711eca0cc492a455a40cc794e0c70f5b59c2a45d6d6aed","observation_id":"5a49883a-7e80-453e-94d2-9a19b3764475","resolution":{"observed_at":"2026-08-07T14:39:06.099849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.329306Z","title":"Remasking discrete diffusion models with inference-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.329306Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:7ba2dd40a844fab4511265a6c0f4d3518af39e7e18155d18d212fa1e60b11beb","observation_id":"63b72750-fdb6-4100-8109-9922448c60fb","resolution":{"observed_at":"2026-08-07T14:39:06.329306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.462125Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.462125Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2e340f8f7139a3f908faa5baf726a787b2ef3a232ba12d6f36039387fdaa8fc5","observation_id":"11f7d00d-5aa2-45ec-b584-68d78733c570","resolution":{"observed_at":"2026-08-07T14:39:06.462125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.559572Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.559572Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:29ea5c82972ee52bd9691fcc67d22cc1532b653e13ed35d23caa378ae7c51a82","observation_id":"24b1131a-576b-42be-8812-9106dfe1551b","resolution":{"observed_at":"2026-08-07T14:39:06.559572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.681448Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.681448Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:defed9d856f76c8d21358efa661c1355015a1993ded3d8a3f4909c0d6c2cb0a0","observation_id":"eb49ba51-7621-4309-9ee0-36f2b9f81b18","resolution":{"observed_at":"2026-08-07T14:39:06.681448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 7 inbound Pith citation observations for arXiv:2505.18456."}