{"as_of":"2026-08-06T20:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2698d8b5b65ec83728a1b129ee4be1040295c89d9fd049c3484c7595deca6dc6","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T01:44:40.722957Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07706/citation-record","integrity":"/paper/2607.07706/integrity","json":"/paper/2607.07706/citation-record.json","paper":"/paper/2607.07706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:51.002529Z","title":"Smollm2: When smol goes big – data-centric training of a small language model","venue":null,"work_id":"5538a0a2-9aa3-42b4-bafd-29119999b5a9","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:45c6252489e5396421363340146c06f89c61af4817bc09d794517bf6df163a55","observation_id":"a1a11d75-8212-47e8-9147-f71e8d92adb5","resolution":{"observed_at":"2026-07-09T01:45:51.004047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"cited_work":{"arxiv_id":"2512.17351","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.17351","snapshot_observed_at":"2026-07-29T02:25:10.816968Z","title":"Physics of language models: Part 4.1, architecture design and the magic of canon layers","venue":null,"work_id":"db795f71-3478-4a9e-af8b-c490bc46e5f0","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2512.17351","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:12e7f8ffb0fd73c4f84f7f01eb8998e678182301b8bd5f7933f65ca240dfc01f","observation_id":"1c5fa7a7-6d1d-4d1d-9c32-6be98e13942c","resolution":{"observed_at":"2026-07-29T02:25:10.816968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14458","last_updated":"2025-02-23T13:02:09Z","snapshot_observed_at":"2026-07-06T20:39:43.403470Z","submitted_at":"2025-02-20T11:18:39Z","title":"Llamba: Scaling Distilled Recurrent Models for Efficient Language Processing","version":2},"cited_work":{"arxiv_id":"2502.14458","doi":"10.48550/arxiv.2502.14458","metadata_source":"pith","pith_arxiv_id":"2502.14458","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llamba: Scaling distilled recurrent models for efficient language processing.arXiv preprint arXiv:2502.14458","venue":"cs.LG","work_id":"114086d3-6e40-4b5c-b2a9-6d0819e2bfac","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2502.14458","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:1a522938359fef44c86fc683a739d6d85eedb7e289a830146f248ba90e494c0d","observation_id":"d39b3710-a3e0-4a4b-adc2-27a39eb5882b","resolution":{"observed_at":"2026-07-09T01:45:50.801202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-02T09:26:59.716070Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:db30894b599af9df029e8e315d6d2a10a17e33220a268370cc5697290f1f7c06","observation_id":"9b0e7378-4798-4d39-ba5b-ea4423ccf2a6","resolution":{"observed_at":"2026-07-09T01:45:50.773278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:bf7191b848a2e51015f0c0115841742dba4ec37f51c86f48e5b75c45d4e66884","observation_id":"beb1f7a4-16a4-4816-a516-dd9062573365","resolution":{"observed_at":"2026-07-09T01:45:50.806926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:85f0ca292b2ce6384b929ab01d90c025fc5fc3df708ea9b0501fa05748b34a2b","observation_id":"ed611160-7512-43c9-b43c-1e129f794826","resolution":{"observed_at":"2026-07-09T01:45:50.776080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:50.790857Z","title":"Myosotis: structured computation for attention like layer.arXiv preprint arXiv:2509.20503, 2025","venue":null,"work_id":"bdf99817-e4b0-4356-b3f9-973c04179b7f","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:e644f5ac74ea14630fa79163efaa1ab4c2fcb1fccf2383d6d28da791223dee44","observation_id":"8cc150a6-935e-4331-9445-62a8333d571c","resolution":{"observed_at":"2026-07-09T01:45:50.793247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01496","last_updated":"2025-05-07T07:42:11Z","snapshot_observed_at":"2026-07-06T20:45:41.540398Z","submitted_at":"2025-03-03T13:08:00Z","title":"Liger: Linearizing Large Language Models to Gated Recurrent Structures","version":2},"cited_work":{"arxiv_id":"2503.01496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01496","snapshot_observed_at":"2026-07-09T01:45:50.818008Z","title":"Liger: Linearizing large language models to gated recurrent structures.arXiv preprint arXiv:2503.01496","venue":"cs.CL","work_id":"55622c06-d5cf-48ff-8c05-e3aed5f2a0d4","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2503.01496","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:cf04f7e12bc416f48b6d8d911b6bbecf1e9cc04e3298bea38258aeb32304bb80","observation_id":"badf63e4-9b46-4040-a5a1-e340e75d872e","resolution":{"observed_at":"2026-07-09T01:45:50.819522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:13.018434Z","title":"Datacomp-lm: In search of the next generation of training sets for language models.Advances in Neural Information Processing Systems, 37:14200–14282, 2024","venue":null,"work_id":"15abfcfe-c8ab-462e-bcbc-44f40064b1af","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:4a01f91722cd5822dabc06f0824eb87fd83c462300a218d8f62dfbc24b4ed507","observation_id":"ac9b756f-d3b0-4a6e-934f-2f4ab6835d34","resolution":{"observed_at":"2026-07-09T01:45:51.005681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-04T14:58:56.675148Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":"2407.14207","doi":"10.48550/arxiv.2407.14207","metadata_source":"pith","pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hanxiao Liu, Zihang Dai, David R","venue":"cs.LG","work_id":"854578cf-e114-4bac-998f-a9ee9f8c7dc2","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:a0eb120f829265b9157091f39f1f375d01363cfe7da858978e25e25a1c374152","observation_id":"d9aa782d-10b7-4a47-a9f0-2772dc025a1a","resolution":{"observed_at":"2026-07-09T01:45:50.821866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:50.761684Z","title":"Lola: Low-rank linear attention with sparse caching.arXiv preprint arXiv:2505.23666, 2025","venue":null,"work_id":"6906023f-f36a-4c49-bc74-17e4f57809b2","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:bb4ae46f5a7d61659877c0df9d6bcab0235debbc2f68fdbcb05e9afd1de2146a","observation_id":"2f15f0e2-306b-42eb-a470-a54da3fd22b4","resolution":{"observed_at":"2026-07-09T01:45:50.763839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:50.765551Z","title":"Still: Selecting tokens for intra-layer hybrid attention to linearize llms.arXiv preprint arXiv:2602.02180, 2026","venue":null,"work_id":"86c05b25-6a67-4583-878e-bbd8cf787904","year":2026},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:fa48d00bf67da7ad7fa9814bf7bdeb54a9687ef4145daa0e2e4eecc7c9233a4a","observation_id":"8850df1b-01d8-417c-92be-03c146576efd","resolution":{"observed_at":"2026-07-09T01:45:50.767488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06640","last_updated":"2024-05-10T17:59:08Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:08Z","title":"Linearizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.06640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.06640","snapshot_observed_at":"2026-07-09T01:45:50.807991Z","title":"Let’s verify step by step","venue":"cs.CL","work_id":"87cc9178-d804-46fe-8128-c9074077dd04","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2405.06640","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:baa30eece5544a9df0af820ccd7affb0621a4bfd24ccdbbac56d21f7924da8cd","observation_id":"6324c5c1-8052-47a0-b218-4a5058a17c09","resolution":{"observed_at":"2026-07-09T01:45:50.809234Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08791","last_updated":"2022-02-17T17:53:48Z","snapshot_observed_at":"2026-07-06T12:38:52.417555Z","submitted_at":"2022-02-17T17:53:48Z","title":"cosFormer: Rethinking Softmax in Attention","version":1},"cited_work":{"arxiv_id":"2202.08791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.08791","snapshot_observed_at":"2026-07-09T01:45:50.805747Z","title":"Zihan Qiu, Zekun Wang, Bo Zheng, Zeyu Huang, Kaiyue Wen, Songlin Yang, Rui Men, Le Yu, Fei Huang, Suozhi Huang, Dayiheng Liu, Jingren Zhou, and Junyang Lin","venue":"cs.CL","work_id":"35328ee6-119e-48c6-98c1-7fa38bc5f20a","year":2022},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2202.08791","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:4c273107174f587c599673b2ed25d62846617c1ed03db1e6323ca652c2c72225","observation_id":"97a13242-9f38-41bc-9ac4-483edc6c57ac","resolution":{"observed_at":"2026-07-09T01:45:50.807122Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-07-06T21:40:07.249021Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"cited_work":{"arxiv_id":"2506.09316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09316","snapshot_observed_at":"2026-07-09T01:45:50.813321Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","venue":"cs.LG","work_id":"3d670f26-8ba3-435b-8d4b-1572f224239b","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2506.09316","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:4e2f8fd2d2a6bcea83bce74488e9c2665c91824233df23fde46fc4d29099f34a","observation_id":"a94b9bcd-0ab4-4d30-aa30-fd841611e3de","resolution":{"observed_at":"2026-07-09T01:45:50.814563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:592ee139f4fe7e22e2f14bcc61dffaa148c87a23021b64047e2408b1ef7b797c","observation_id":"8f200e1a-5ef3-4a27-879c-08d3dfc127b6","resolution":{"observed_at":"2026-07-09T01:45:50.793445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:51.002714Z","title":"Eleutherai/lm-evaluation- harness: v0","venue":null,"work_id":"c4ab6a81-60e9-49d4-938f-e4282bcde31e","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:047e5395f62a9dedcf660b5a80a56a7a3f50ef70cc05cfff420652869ac5bb2a","observation_id":"bc54ed6c-7f2e-4a25-a5d6-5ef8fe10acca","resolution":{"observed_at":"2026-07-09T01:45:51.003849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:53.827539Z","title":"Hashimoto","venue":null,"work_id":"35104f7e-ffc3-488e-b66a-a4d3d230e657","year":2023},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:3b2cc90d19e7e800db9dfa050e0f9a9c33528a1615b9f1932c3a65e33e6ab6fd","observation_id":"04bb47d2-3404-45b8-b16d-5a0aab49579d","resolution":{"observed_at":"2026-07-09T01:45:50.998378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:29ac313ab4a4f9224d5a1aa7cbcf057d10a09834b471db03fda6530b25b086d5","observation_id":"c2eb8bcd-5ac9-4afe-8186-fee909aa5f6e","resolution":{"observed_at":"2026-07-09T01:45:50.809547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"cited_work":{"arxiv_id":"2507.09025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09025","snapshot_observed_at":"2026-07-09T01:45:50.815719Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","venue":"cs.CL","work_id":"33933867-6666-4655-8ac1-ff265f1b6c4b","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2507.09025","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:df77e03265758de527b153bdd37cb27d9c2e3f5d2c122990cc6886ce3f8b7895","observation_id":"bc89b400-019d-4c57-9abc-5255a367504f","resolution":{"observed_at":"2026-07-09T01:45:50.816968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:cece12b4a35d42bed0f4614fca463ba9dddea1874737b1216c8f0236a5ce0f79","observation_id":"38063336-8d91-4dab-842e-2e5d3cc6c6b5","resolution":{"observed_at":"2026-07-09T01:45:50.815396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":"2412.06464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-10T21:57:39.161066Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":"cs.CL","work_id":"884939d3-e283-4625-bff4-b7e0e4cc2a6e","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:df17e927d43465a2fb8d2f2c8091e36f99e6d3c94a73a59323faae21a9df7403","observation_id":"ce2750ac-637f-4774-a96d-d1dc04e9b6d9","resolution":{"observed_at":"2026-07-09T01:45:50.789713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":"2312.06635","doi":"10.48550/arxiv.2312.06635","metadata_source":"pith","pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":"cs.LG","work_id":"65a18a30-6e80-4b64-a026-bb0368e38872","year":2023},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:cafa212f53229de59e7005b7341e55b5311d430e647f92005d237102e8262ba9","observation_id":"7c78e882-8a54-4f3d-8991-473c8715a693","resolution":{"observed_at":"2026-07-09T01:45:50.764137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:51.000605Z","title":"Parallelizing linear transformers with the delta rule over sequence length.Advances in neural information processing systems, 37:115491–115522","venue":null,"work_id":"e95f6868-6e32-4ec1-b303-4d88adfe9ff8","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:c8116669eaa98d0af9c28fc065245bcb8191b8b7992a98434d16aa656ae48f2e","observation_id":"144dd589-9c86-480e-8cd9-47d2d65b65d3","resolution":{"observed_at":"2026-07-09T01:45:51.001972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:45:50.999069Z","title":"Fla: A triton-based library for hardware-efficient implementations of linear attention mechanism, January 2024","venue":null,"work_id":"84ec34c2-0327-442f-a3fb-dfe8bcbaf187","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:7c429f84945c11af800b5900494538dfad751949a67fb807898a8b4dcf696a53","observation_id":"90508fbf-8228-4f85-84d1-5d9ac8431159","resolution":{"observed_at":"2026-07-09T01:45:51.002161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10254","last_updated":"2025-03-05T21:57:04Z","snapshot_observed_at":"2026-08-05T10:56:29.177473Z","submitted_at":"2024-10-14T08:10:34Z","title":"LoLCATs: On Low-Rank Linearizing of Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.10254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10254","snapshot_observed_at":"2026-07-09T01:45:50.782998Z","title":"Lolcats: On low- rank linearizing of large language models","venue":"cs.LG","work_id":"9d869e4a-9d42-44fa-bb5d-b5e48ac4aed3","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2410.10254","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:786293268d11ca4fbbcc5bea3f26c27b283e6d57c5d1ff823a99c98f86c69247","observation_id":"8c36ea68-9b8b-450b-832a-0d6745f01e7b","resolution":{"observed_at":"2026-07-09T01:45:50.784951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04347","last_updated":"2024-02-06T19:31:26Z","snapshot_observed_at":"2026-08-05T14:10:32.523531Z","submitted_at":"2024-02-06T19:31:26Z","title":"The Hedgehog & the Porcupine: Expressive Linear Attentions with Softmax Mimicry","version":1},"cited_work":{"arxiv_id":"2402.04347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.04347","snapshot_observed_at":"2026-07-09T01:45:50.823193Z","title":"org/P19-1472","venue":"cs.LG","work_id":"677d5107-6308-4640-bd1a-47e49d1ec496","year":2024},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2402.04347","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:add5ebb18173ad7cdd605c8e3ccccb019f9577f3d568569437c330b27859781d","observation_id":"a11d6df4-fc7c-46e9-96bb-339fd9c2ed79","resolution":{"observed_at":"2026-07-09T01:45:50.824736Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":17,"verified_fuzzy":6},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.07706."}