{"as_of":"2026-08-08T23:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:802c83754ecdc0e58bf9115798b13b404566eb010f597a6be049ad59d417cb09","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:20:45.911627Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03340/citation-record","integrity":"/paper/2507.03340/integrity","json":"/paper/2507.03340/citation-record.json","paper":"/paper/2507.03340"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:20:44.849068Z","title":"Dosovitskiy","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:44.849068Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:cf3db9819949e81849a5af8378b40a3e7d7e15dfcb4f0236c5246ae42bab585a","observation_id":"388c28c0-eb93-44e9-99a8-8cdb77e13fa6","resolution":{"observed_at":"2026-08-06T20:20:44.849068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:20:46.594744Z","title":"Kasai, H","venue":null,"work_id":"55aa50d4-7072-4d51-9974-889f53d15814","year":2021},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:44.987614Z"},"links":{"citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:ac44c31315103eec2c91e21c8303ab7202e459df24a7c17c58fab6c55094f4d9","observation_id":"f861ce85-a9de-4744-a2b0-b7debd850260","resolution":{"observed_at":"2026-08-06T20:20:46.670584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:20:46.207166Z","title":"direct” loss. This is natural because the cross entropy loss for next-token prediction is used in “direct","venue":null,"work_id":"36350c79-06f5-4cfe-a921-07d086343421","year":null},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.911627Z"},"links":{"citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:b2b631922285f12d8ab86da288165e8fbc5ab2ace3ac2f48ef35bc29d20f5ff2","observation_id":"78651683-8be8-495c-9bc2-70f2f9278298","resolution":{"observed_at":"2026-08-06T20:20:46.259058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T20:20:45.766234Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.766234Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:67c48cd706142cf27bb1e4292edf74037b84b9bb0dc7e7b51d1e11bd99515283","observation_id":"9bcdbe42-d596-49eb-b26f-969247eb8437","resolution":{"observed_at":"2026-08-06T20:20:45.766234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:20:46.350624Z","title":"• K : Rd × Rd → R is the positive definite kernel given byK(x, y) = Ez∼τ [ϕ(x; z)ϕ(y; z)], where τ is a probability measure on a measurable setZ, and ϕ : Rd × Z →R is a feature map","venue":null,"work_id":"6eced685-d2bb-4f64-a0a2-2907feae01a1","year":2017},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.845845Z"},"links":{"citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:959f247a647516a18cbd906add68c12f9bf4a1bff659124f7ae08db5206ef508","observation_id":"643d0de8-beb3-415d-bac1-0a91e45281a8","resolution":{"observed_at":"2026-08-06T20:20:46.404280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17574","last_updated":"2024-01-31T03:39:07Z","snapshot_observed_at":"2026-07-06T17:22:53.623679Z","submitted_at":"2024-01-31T03:39:07Z","title":"Scavenging Hyena: Distilling Transformers into Long Convolution Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17574","snapshot_observed_at":"2026-08-06T20:20:45.341397Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.341397Z"},"links":{"cited_paper":"/paper/2401.17574","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:8b7778ec819fe8d43ea4cc39356726020163900346ff83d4bcfd9c30658d7456","observation_id":"989f48a6-8f41-469b-9540-2095b8d385eb","resolution":{"observed_at":"2026-08-06T20:20:45.341397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-06T20:20:45.152141Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.152141Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:40bfad8a92ef9422785b1efe4c7190467ec23e9e1da33b9388dde509e17c133e","observation_id":"96359c09-3a7e-4c60-820f-940e4e64484c","resolution":{"observed_at":"2026-08-06T20:20:45.152141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-08-06T20:29:20.982892Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-08-06T20:20:45.689403Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.689403Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:da19e5130088e2b0743781793a7d945faa8e2255f5ab488957d24880df2b7137","observation_id":"e9165664-45c3-4da1-9cbd-34d955ad0e27","resolution":{"observed_at":"2026-08-06T20:20:45.689403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:20:46.763181Z","title":null,"venue":null,"work_id":"4fa8831c-9a6d-462c-b0f9-d97f33f14080","year":2018},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:44.742887Z"},"links":{"citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:8c5ed0e9dcf9c1fa67be00f2cbac88ca1d8b33586082ffab2f4477e94f647fcf","observation_id":"7cd2de6b-795d-4078-a062-e6e4f1d3cbac","resolution":{"observed_at":"2026-08-06T20:20:46.799700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:20:45.609916Z","title":"Sakamoto and K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.609916Z"},"links":{"citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:34913e7b792578a67558953691ca176c6277c07f756ccf3e71d42041754b180d","observation_id":"fba1e96d-fd8e-4112-97a3-ba5626d73da2","resolution":{"observed_at":"2026-08-06T20:20:45.609916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19928","last_updated":"2024-04-01T09:17:01Z","snapshot_observed_at":"2026-08-06T07:05:21.216187Z","submitted_at":"2024-03-29T02:32:15Z","title":"DiJiang: Efficient Large Language Models through Compact Kernelization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19928","snapshot_observed_at":"2026-08-06T20:20:44.462608Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:44.462608Z"},"links":{"cited_paper":"/paper/2403.19928","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:d27745d9d8dffc461ea979c975497a4650a419982c6430cf0128d06e1ef595eb","observation_id":"4920c157-511e-4a80-ad76-b027ccf4f504","resolution":{"observed_at":"2026-08-06T20:20:44.462608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T20:20:44.602537Z","title":"Clark, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:44.602537Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:da0d00c2e7615cb190243a7f2af222dda6729da82d870d997c6d29a7ef5ade6a","observation_id":"78264015-2891-49f7-8732-d3f03fdaa226","resolution":{"observed_at":"2026-08-06T20:20:44.602537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:20:46.468180Z","title":"Ravichandran, A","venue":null,"work_id":"ae76a57f-17f8-4ca6-a0b8-18c6462a41a2","year":2019},"citing_paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:45.521317Z"},"links":{"citing_paper":"/paper/2507.03340"},"observation_digest":"sha256:eeec6dead5f8f68aae6f233c960f2e7f7e78818d487f78824675d989713a5c57","observation_id":"70cf876f-4c6d-4a79-a797-30c1114bd463","resolution":{"observed_at":"2026-08-06T20:20:46.532723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03340","last_updated":"2025-07-04T06:59:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:10:29.802949Z","submitted_at":"2025-07-04T06:59:17Z","title":"Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2507.03340."}