{"as_of":"2026-08-23T11:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61aab0f26a2d8c1d2013a9ee121fffff97a9e146b85659ac1045bf69c3ca9a7d","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T14:48:23.587464Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07953/citation-record","integrity":"/paper/2607.07953/integrity","json":"/paper/2607.07953/citation-record.json","paper":"/paper/2607.07953"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.662523Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":"f9293f66-8a5b-4429-b309-96009014e91d","year":2017},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:f608b358f5fa64901e78fe19edde2a74b745cd37aa7cb17ae967cb83aeca21e8","observation_id":"602e2e78-d5ba-474a-8eb1-766a948fa931","resolution":{"observed_at":"2026-07-10T14:57:14.663518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.660867Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"b52b5282-7b30-439e-b302-3c177047ef94","year":2021},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:bc96219f2de1665b1915a39e73f66f5bce235cda2637148791db1001cec9b212","observation_id":"24b9ad8b-d657-484a-b6d0-e28f7604ff6e","resolution":{"observed_at":"2026-07-10T14:57:14.662006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.655856Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":null,"work_id":"06b93408-6884-4354-b249-9d972d278cb4","year":2025},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:d9b76583449ef79d2e62d946dbe4c4a99ef16cf5dc2a8dd40b06856892e41aef","observation_id":"7387cc04-ff83-4d2d-8629-77c3a51d8c54","resolution":{"observed_at":"2026-07-10T14:57:14.657059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:da78a43334251145865738c43476e9da62cb48c5e1d4f4e73eca26eb3a2331ee","observation_id":"bc7af603-b610-4bab-b73c-5877701bfd55","resolution":{"observed_at":"2026-07-10T14:57:14.483248Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22791","last_updated":"2026-05-21T17:44:57Z","snapshot_observed_at":"2026-08-17T19:58:31.549937Z","submitted_at":"2026-05-21T17:44:57Z","title":"Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention","version":1},"cited_work":{"arxiv_id":"2605.22791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.22791","snapshot_observed_at":"2026-07-10T14:57:14.497276Z","title":"Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention","venue":"cs.AI","work_id":"bee8fecd-2f30-43b0-893d-f38e64c763e0","year":2026},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2605.22791","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:8f8c2c0a6912a8d4756415b02b2ca56a5783758c64233d6e3106da7910567c9b","observation_id":"b3a73c11-0011-4d4f-b609-55f4e97f5b33","resolution":{"observed_at":"2026-07-10T14:57:14.498464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-16T13:30:40.009888Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:1d95a3ee378f39ff1233008ad4a9997081204cb5669cb650da2dc294a40a381c","observation_id":"8aab5da6-f6fe-40f9-ba9b-85a8fabd0508","resolution":{"observed_at":"2026-07-10T14:57:14.485595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15619","doi":"10.48550/arxiv.2603.15619","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-","venue":"arXiv (Cornell University)","work_id":"a19f22c0-0ac7-4fe3-975a-1cc204cec78c","year":2026},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:5cc0f859cbc61c426b78bcef837f2e3ba4ee14626f96bc467808b2edddec85e2","observation_id":"3f055e42-ff79-4df0-a0b9-8672b978a1ce","resolution":{"observed_at":"2026-07-10T14:57:14.488298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.530513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.530513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.657672Z","title":"Value Residual Learning","venue":null,"work_id":"64e30e48-ce49-41b0-a1ac-e7fedec476eb","year":2025},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:f70f6eb254007a5d941c91c1ce6bccb58e4ae05d1bc65e55d3840a434bb5412c","observation_id":"439408e4-f795-4bb9-a955-9649a2b1836d","resolution":{"observed_at":"2026-07-10T14:57:14.658787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-20T16:41:47.138179Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:20ae87114c96bba20bd40d5af29297fb1cae9ffa876154c134343e2528cb4836","observation_id":"c350d427-ad0c-462d-b818-501adaf1b9a7","resolution":{"observed_at":"2026-07-10T14:57:14.496071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:10.326889+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:10.326889+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:c82b7acc8b36414eb8c9f674395b0af46c9b9a54498fe9eef96c8cb8fca22254","observation_id":"e2cb0f54-7e88-4cd1-ba20-5a83123df5e8","resolution":{"observed_at":"2026-07-10T14:57:14.493562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.659375Z","title":"and Hutter, F","venue":null,"work_id":"9b058399-f143-43d2-849f-6fd036fa3d94","year":2019},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:f8dae090b74837567fe7c6e3eb0d4d0da47c356f61d86341f6a6e283d499f83b","observation_id":"5a388a0f-1dc3-4f69-bc76-256aa9750817","resolution":{"observed_at":"2026-07-10T14:57:14.660384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9652.7097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.489419Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":"278ec8a1-d989-4cd3-8421-7797af8defe6","year":2024},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:82d37344b0f24d3aa3545dc9a10341289943980d7c7a4fffe130e588a438abde","observation_id":"d1348af7-48e4-4c2c-b097-811fcfbcb216","resolution":{"observed_at":"2026-07-10T14:57:14.490923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T11:40:43.207872Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":5},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2607.07953."}