{"as_of":"2026-08-06T02:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1dd435be587b3887c400e92de60ac26553487e65464d2d503bb34c64acee4d7","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:14:31.291528Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:13:09.677634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09992","snapshot_observed_at":"2026-07-11T08:05:17.460513Z","title":"Eldenk, P","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05147","last_updated":"2026-07-06T14:28:06Z","snapshot_observed_at":"2026-07-31T15:07:06.604191Z","submitted_at":"2026-07-06T14:28:06Z","title":"DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation","version":1},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-07-11T08:05:17.460513Z"},"links":{"cited_paper":"/paper/2605.09992","citing_paper":"/paper/2607.05147"},"observation_digest":"sha256:d3e318c304caee9034c3a08f81a67440987ab719758376387ab12974b3fedeb7","observation_id":"3c641cb6-7648-4160-948f-83239dbf19fd","resolution":{"observed_at":"2026-07-11T08:05:17.460513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09992","snapshot_observed_at":"2026-08-01T07:13:09.677634Z","title":"arXiv preprint arXiv:2605.09992 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21535","last_updated":"2026-07-23T17:21:44Z","snapshot_observed_at":"2026-08-05T10:47:47.863363Z","submitted_at":"2026-07-23T17:21:44Z","title":"Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T07:13:09.677634Z"},"links":{"cited_paper":"/paper/2605.09992","citing_paper":"/paper/2607.21535"},"observation_digest":"sha256:a6236b1c91653bdecd4def2f89eda23a1abd9434b6a4a39bf5287456fb9aacfd","observation_id":"7bbb746f-acd3-4787-8a93-307723dcbcf4","resolution":{"observed_at":"2026-08-01T07:13:09.677634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.09992/citation-record","integrity":"/paper/2605.09992/integrity","json":"/paper/2605.09992/citation-record.json","paper":"/paper/2605.09992"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:53:51.199808Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"1fbe276e-0625-47a5-88b5-ded8d9608969","year":2023},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:f9ea7d79024e5dda6fb3c526be45244527d422e79fdcf1bcdbb34f51a3edff96","observation_id":"0387b58c-05c3-4265-902c-2d54fae86713","resolution":{"observed_at":"2026-05-12T23:36:57.371364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":"2302.01318","doi":"10.48550/arxiv.2302.01318","metadata_source":"pith","pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","venue":"cs.CL","work_id":"b53b11e5-8613-439d-9d9d-0e2a9090d79f","year":2023},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:abfc41c5199d6b51ce2abe661423a5abd0b42ddf44f87b61e1e0bf5d13bf8bb4","observation_id":"04be06cf-0d12-4c53-b899-5e798f6d0449","resolution":{"observed_at":"2026-05-12T02:16:15.854513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duoattention: Efficient long-context LLM inference with retrieval and streaming heads","venue":null,"work_id":"be6a6789-ffe6-4159-a936-9c4226df4877","year":2025},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:516454cf3ef6c062a80e8a26fbf53b5dc5becc73103104a2ae5f2888342ea980","observation_id":"8a614a83-1c78-4a4c-ac42-4753069b7f64","resolution":{"observed_at":"2026-05-12T23:36:57.296799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longspec: Long-context lossless speculative decoding with efficient drafting and verification","venue":null,"work_id":"cc123e1d-f0b7-4b06-89c5-3e921bc28915","year":2025},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:15aaf951af7e5816b91548f5414c3333ac550411f9134828e867163e2a2827e0","observation_id":"e47de48d-062c-49b2-b8cf-ce17fbb743bb","resolution":{"observed_at":"2026-05-12T23:36:57.323845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EAGLE-3: Scaling up inference acceleration of large language models via training-time test","venue":null,"work_id":"39b30693-51ff-42a1-a74a-f4ec2eab170e","year":2026},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:aee103fb41951e4aecc9be1a165162b78dc863165b868bdc6e34edace89cd743","observation_id":"ca8dd930-7ca6-429c-b109-8e24fcf1f816","resolution":{"observed_at":"2026-05-12T23:36:57.333157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":"64e6335d-bcf8-4f95-a5f8-75c6527cd6ab","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:85169f1c7cf81de774dca38545f1e6f9d1eaa64959aa2e659e321ebcb9ff1db6","observation_id":"d259b6b1-273a-455d-ac82-82a933c51a06","resolution":{"observed_at":"2026-05-12T23:36:57.352219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EAGLE: speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":"20b5cf9c-051b-4deb-bfd5-50c5b2866c70","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:60ba1d187f84c36d584a5d1d3eedbb830906e6491e3a844e85febf5580ae7d63","observation_id":"51d116c3-4000-4dab-b313-d20aad3eb29b","resolution":{"observed_at":"2026-05-12T23:36:57.339075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eagle-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":"519ca375-3001-432e-8cbe-4371d220632f","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:109aeb1fc5ec9a8fda338461ef676abf8016e8325b9ebcc3512fb98d1efc9a27","observation_id":"b0ac6791-5bd7-4930-b727-deb685133950","resolution":{"observed_at":"2026-05-12T23:36:57.343701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:af4a1ea923a23d5f77e9b3b01eb75ea49668c4861455d690039ab3d430892af1","observation_id":"cac23b1d-ddc5-43b3-8f45-f32c202f524b","resolution":{"observed_at":"2026-05-12T23:36:57.302388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T09:02:13.068592Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"55d06a5a-70ca-433f-966a-21dd9d276d2b","year":2023},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:59f1c6a1551005471bdae4120da7d58f473822eadc15bd300ab0d7a3aeac5016","observation_id":"132f235c-2a89-45ba-a87f-809672898e07","resolution":{"observed_at":"2026-05-12T23:36:57.328690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583","venue":null,"work_id":"889462de-9d24-4aac-8847-18d7f5ed8899","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:1ea89c87accb1f556ced78d79e337de3ef4caced25cac81eb07406d450438cc9","observation_id":"89ea6913-6648-4327-9853-1f4ef9799948","resolution":{"observed_at":"2026-05-12T23:36:57.361470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"50f04710-49cb-4044-b239-f6e81d23ad17","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:5ffb3e085d7be94ad82420a50cd0612b5e4a2f2446d52e745f26b198bdede360","observation_id":"720fd475-ba19-471b-bd0f-8dc0dbda3935","resolution":{"observed_at":"2026-05-12T23:36:57.356699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:25:49.334484Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"5ac99f1f-14da-41e3-955e-1f096e0f9b95","year":2023},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:45511d72481800ddd5984f4cf918547940ba26fc96d8a40a15a8308ba44c92ec","observation_id":"024fafc6-3e0e-4638-9983-41b1cf7eb0ae","resolution":{"observed_at":"2026-05-12T23:36:57.310433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:da924e30092d644bdd7583a4994200a2079fa354556b20002c0f0d3b5e011a78","observation_id":"1c9b20d8-3669-486f-a094-0ab4d07a05c8","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicdec: Breaking the latency-throughput tradeoff for long context generation with speculative decoding","venue":null,"work_id":"b8917750-af0e-4f60-9659-4cf5346f3276","year":2025},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:fa88d763b8e2532041adda1b38cae087789083c80acf096a9c0a982f40327047","observation_id":"0c790067-0c52-427d-b849-3ba7b8d685e5","resolution":{"observed_at":"2026-05-12T23:36:57.375683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.251886Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"217e4962-b6b3-4402-ab00-96bc6344fb75","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:359ba4791b357a24a8f4f7e665af86d13bc7a71f94faf9ab93b0b41ee59dee4c","observation_id":"0a9b10bc-5fe9-40dd-8e5e-fb2724a92de1","resolution":{"observed_at":"2026-05-12T23:36:57.319566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":"9a4c18e0-5338-40f2-b040-1950a382c584","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:0f7b2a84b951f4acbdfd9753379bb44bdce1100a94dae4a6b2e7a4297699d948","observation_id":"de26b050-9c4e-451b-a912-62c944659849","resolution":{"observed_at":"2026-05-12T23:36:57.366373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hydra: Sequentially-dependent draft heads for medusa decoding","venue":null,"work_id":"10593df8-57b2-4b24-b8e7-a21a11d45905","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:1a1caad9a2d19a6c9f8d8b925550f557c15071dd3627c01068524a7b43bb78db","observation_id":"0aafff01-a860-40ae-bf4b-d938a95c0f41","resolution":{"observed_at":"2026-05-12T23:36:57.314741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06036","last_updated":"2026-05-28T09:13:25Z","snapshot_observed_at":"2026-08-03T04:09:50.707111Z","submitted_at":"2026-02-05T18:59:30Z","title":"DFlash: Block Diffusion for Flash Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2602.06036","doi":"10.48550/arxiv.2602.06036","metadata_source":"pith","pith_arxiv_id":"2602.06036","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2602.06036 , year=","venue":"cs.CL","work_id":"860ff726-6feb-4917-a25f-95159b43dd49","year":2026},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"cited_paper":"/paper/2602.06036","citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:2b1d11420ac426f46d5e4d014f3279b3a36fb946fc4c8338483d9db6d22273c7","observation_id":"54740bfb-1d04-4ef3-85ef-d25179d24f23","resolution":{"observed_at":"2026-05-29T02:05:01.756664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated at- tention for large language models: Non-linearity, sparsity, and attention-sink-free","venue":null,"work_id":"30c5760b-a3be-4ad7-9803-86b3c757243f","year":2025},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:11041fef4c8e6b1112d49444e011dff1c8d97da9a993501466feb811286cd565","observation_id":"a3e90fda-dfdd-442b-971a-b4a880b43114","resolution":{"observed_at":"2026-05-12T23:36:57.292130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.917876Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":"ce40d691-df4d-4e1b-8e6a-487892fa040a","year":2020},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:e105f7372215d4d78b9b0f905f69090b16d629523f839abc5c2278fec08a9f44","observation_id":"ff74305a-cc0d-4a8d-9c7f-25cfc281dd91","resolution":{"observed_at":"2026-05-12T23:36:57.306473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the role of attention masks and layernorm in transformers","venue":null,"work_id":"30f31d86-e32d-46ce-9dd2-063e783af6ab","year":2024},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:33b2f4d023faf4e3d7dcedc0f84516b91702dd64f4918cde7f25c111d2a5d433","observation_id":"a3190540-889a-43fd-a487-a416e9835f3c","resolution":{"observed_at":"2026-05-12T23:36:57.348119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":19},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2605.09992."}