{"as_of":"2026-08-13T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:837245c33c67ff91e004d39245c5358ef537609b2321262d6df37ea62a7132e4","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T10:06:51.628147Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.27748/citation-record","integrity":"/paper/2606.27748/integrity","json":"/paper/2606.27748/citation-record.json","paper":"/paper/2606.27748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.861284Z","title":"Simple linear attention language models balance the recall- throughput tradeoff","venue":null,"work_id":"a18785d9-e8cf-447d-b8e8-cc4c5bf0d9f8","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:da6d06b5c236ca480b2102e5f09ff82d5b870af398109ef80e534ab27867d6b2","observation_id":"5ac9e262-1030-4299-9623-3459469c60dc","resolution":{"observed_at":"2026-07-09T15:26:18.862508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.852107Z","title":"Adaptive input representations for neural language modeling","venue":null,"work_id":"346aaab2-34a6-4d17-907a-f9e17c129c76","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:1ae7a366cfd7449519ab6098646ce23557c68d2856b0bc382eae7ddc615ba267","observation_id":"78583070-fe6e-4fb4-9cd4-52aeb22a74fe","resolution":{"observed_at":"2026-07-09T15:26:18.853260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.842949Z","title":"Peters, and Arman Cohan","venue":null,"work_id":"7e2a6943-4643-49c9-b6e9-87a4a64e6a63","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:88e0271c7dc38cb91d0ba1cf96cfedc3726d490d1f5a40151f2d6ae018e187ad","observation_id":"989560e7-6ee7-4f61-9394-2fecddc23cc3","resolution":{"observed_at":"2026-07-09T15:26:18.843985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.884309Z","title":"Courier Corporation, 2005","venue":null,"work_id":"9126272a-ac98-4ccd-9ace-b02fdb851429","year":2005},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:7d314a1aa8df491aac5fc27fcdb79dd6b0ccb00937851bcfd3a6d585c12ff279","observation_id":"285ad435-42c0-4107-a050-4507d03efdd5","resolution":{"observed_at":"2026-07-09T15:26:18.885391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.875090Z","title":null,"venue":null,"work_id":"61c688b0-3aff-42e4-a78f-6299dcf9715d","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:389d64b64212414f2823313ade2dfa6800c77b260f73d7ac3d85461eea109fc0","observation_id":"cb0c95cf-932a-4162-bb9b-a34db98c9e38","resolution":{"observed_at":"2026-07-09T15:26:18.876169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.117656Z","title":"Skyformer: Remodel self-attention with gaussian kernel and nyström method","venue":null,"work_id":"39efb542-1e0c-49d3-a55c-0275214e0d09","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:8dcd0bb0a7387736980500a2e074697e64ea1c242cf96c97ea0e8fa7d61e6be3","observation_id":"957250ce-f71b-4ec4-a104-6df532f4ef1f","resolution":{"observed_at":"2026-07-09T15:16:19.118830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.855834Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"e39726a7-eda5-4964-9c8d-8dde5821fdca","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:cf8e1e967f79bf67cfd3b5d482640e84f62980f284df9683b3820cab3a33d01d","observation_id":"3b1c9a11-4a08-4164-a7ed-ef5bcab0f151","resolution":{"observed_at":"2026-07-09T15:26:18.857100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.854077Z","title":"An exploration of softmax alternatives belonging to the spherical loss family","venue":null,"work_id":"0c3c15e8-e3ff-4b81-accc-5f1926b11927","year":2016},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:a16b952ca39c20b992400f1bda892fefb457e05d0c20e2524fa91cf07c6b655f","observation_id":"d977218f-d7f1-4e56-8caa-e6291a47c60d","resolution":{"observed_at":"2026-07-09T15:26:18.855244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.895284Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"cc836bcf-adf8-4dc6-897a-9e2a50caa22a","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:75cffdb35d69e6f307a793b35f2c7b4e788fd1d92d5828d6cb7b4632c594bfe5","observation_id":"7a6e44d5-86f2-4831-b2ca-14bd101ec81d","resolution":{"observed_at":"2026-07-09T15:26:18.896562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.875269Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"b2cc82a1-974a-4867-8a88-379d15de9985","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:2143fbf578b59e3c365e187399fbbf48e29551f5e89e4668edb6d2865db29639","observation_id":"5b28ac1b-b29c-4e1f-9509-f8c7da9ba433","resolution":{"observed_at":"2026-07-09T15:26:18.876488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.876993Z","title":"Building blocks for a complex-valued transformer architecture","venue":null,"work_id":"977078e6-b6ab-4a9c-8841-12db9edf52ba","year":2023},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:81663910dfbb99b2185fc4b87131dce722b89feb9e5e9c74090adc397b5a95e8","observation_id":"4f3562b4-5559-4191-9557-5e20c74043a4","resolution":{"observed_at":"2026-07-09T15:26:18.878306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.873411Z","title":"Parallel and serial grouping of image elements in visual perception.Journal of Experimental Psychology: Human Perception and Performance, 2010","venue":null,"work_id":"cdcdb185-bacc-45a0-a763-9c620f195946","year":2010},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:36372d19df83d99c21911bc556b3b5fd9a10861e8275aeaf8987d0db4bb70b03","observation_id":"b82fece8-0c89-41cc-b515-783b5dc3c780","resolution":{"observed_at":"2026-07-09T15:26:18.874683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.143820Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"216a0bd9-2823-41f9-8c5d-337b05939501","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:34fae4e2584a0fd51d226c7905be6ec5c69f0e2b73779e040d2b2d86525e1548","observation_id":"56aeab89-6d20-4c55-9d44-37da58605d94","resolution":{"observed_at":"2026-07-09T15:16:19.145175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.790648Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"961ef8a5-d589-421a-807e-e454fd585949","year":2015},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:7cb62c16954aa0148cbcb65d1881b19f679accbe837db3726e2bad2f922faf23","observation_id":"6f769275-31bf-49a8-ab06-19e786c2b01a","resolution":{"observed_at":"2026-07-09T15:26:18.880023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.882600Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"adf0b21e-4f59-4801-b411-e1e6d7fe266e","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:86e46ce88408844e66de9d9ad25ef514169289c50e83d16a3fd422470ff3779e","observation_id":"ada2f3fa-384e-4da6-a87d-1ab9efd367b7","resolution":{"observed_at":"2026-07-09T15:26:18.883667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.113733Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"298093d0-0364-4ca5-879f-2ee9aaff0d97","year":2009},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:8c9ac29a9a82a6731715dd8792b0a08bd7341c4b21889556f593370bfd6ec482","observation_id":"96dc22df-033a-49c0-bc8a-6eb5f208c293","resolution":{"observed_at":"2026-07-09T15:16:19.115064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.111778Z","title":"Figueiras-Vidal","venue":null,"work_id":"d202c73b-dc93-4132-8872-19786a4cb68e","year":2010},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:7c88f2500721fbe499d7d144b26caec4c25049dbbd8b600f3c6d0dc42b00530b","observation_id":"0a65fc9f-1e67-412a-a781-75a6d9a51c2f","resolution":{"observed_at":"2026-07-09T15:16:19.112829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.139779Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv, 2019","venue":null,"work_id":"52178b77-6a11-409c-8b51-8bee73f5a790","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:070a680a51d72c6eb7b9aa64df5c730dce1f91603764208d4d368d1227bcadf4","observation_id":"b54375a6-ef0e-456b-9eb7-ad0656f42314","resolution":{"observed_at":"2026-07-09T15:16:19.141136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.885990Z","title":"itransformer: Inverted transformers are effective for time series forecasting","venue":null,"work_id":"778590bd-8eef-4908-a05a-8e1cf4e7e8d3","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:c0fe7bc27faa5e27cff100eb3bf7c7e6dfa19626e3065643792a199fd9241a18","observation_id":"f844982d-21aa-4ad9-8b20-d59e100f8f4d","resolution":{"observed_at":"2026-07-09T15:26:18.887171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.897055Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"4cb3b92f-6088-41c4-92d5-8e531976662b","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:30937dd1f33098da0bbcfddb4821fcc35cf0710b58a1de640616b8c41c1a5c80","observation_id":"b5f6851c-92df-440b-9f9a-70e17f7c8d1d","resolution":{"observed_at":"2026-07-09T15:26:18.898258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.871471Z","title":"Maas, Raymond E","venue":null,"work_id":"cdb4d29e-4d02-459a-8013-337e1982cbda","year":2011},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:0b53ab791223eea3e32033632baeab85d3013580eee47831c0985cd7c7d4544c","observation_id":"d3752728-1c40-429b-ba3f-a9faa7f6ad97","resolution":{"observed_at":"2026-07-09T15:26:18.872787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.893341Z","title":"Polaformer: Polarity- aware linear attention for vision transformers","venue":null,"work_id":"74c1bc43-a226-4bf5-9f91-1725dfc2a50d","year":2025},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:0509c4512ab84819e976fa45e94d3adac07149ab87cf26fdfa6e224b06d17858","observation_id":"6bacb3c7-83b2-462c-a3c6-902b94d82d09","resolution":{"observed_at":"2026-07-09T15:26:18.894459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.141805Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"11b009f0-d277-4043-b41f-45148f44bbef","year":2017},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:cd39d3b039ab8ec55ba92ba49be3cce6abcd8fad6abb08853291bd84537e589b","observation_id":"c94f2af3-5aa2-4cc7-99c6-0db6cd123f97","resolution":{"observed_at":"2026-07-09T15:16:19.143183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.852470Z","title":null,"venue":null,"work_id":"453eeb76-9f1a-4335-b8fe-172b7578a1e6","year":2018},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:7d3948593d59c5309763be2b977bd38abebad6131d4ecd6a6daa57b1b0f36eb3","observation_id":"b3e47719-c030-4462-a43c-22e4f85ca298","resolution":{"observed_at":"2026-07-09T15:26:18.853552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.883009Z","title":"Nguyen, Phanwadee Sinthong, and Jayant Kalagnanam","venue":null,"work_id":"a61e38df-6a84-47f6-bab3-5ebe2d2dea78","year":2023},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:9ed08230abefdeba701b1ce57f1819de9c9e7cf4e9905dc33e262e23914fc282","observation_id":"5c19b8e7-038b-4e24-bc25-2a8e734040a7","resolution":{"observed_at":"2026-07-09T15:26:18.884133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-06T00:26:50.886840Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":"1904.01038","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-07-01T23:06:20.161421Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","venue":"cs.CL","work_id":"60f0096a-3ae5-43f2-9275-a23a441325dc","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:e5201f21979ae102f4d4c65db6ee42f65920bd9a20eadeb99868ba4f5ec81bcd","observation_id":"2e83538d-38cb-4d75-875e-1571f4e2cedf","resolution":{"observed_at":"2026-06-30T12:54:40.216369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.887856Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"999aac67-2a63-4226-9e36-d9358b062b77","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:411a3b968606564b37940483cf13e1102fadeddaaf226338fea6cb8e2917dba6","observation_id":"ce7a51b7-4df9-47f5-97a3-ce6deb4e1dcb","resolution":{"observed_at":"2026-07-09T15:26:18.889076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.889650Z","title":"Random feature attention","venue":null,"work_id":"cf714735-950b-4e8d-8799-38142fc14397","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:72635a968247241a12431800ce09c39f77c5d748a2a25093e9104043023ec9e8","observation_id":"f0edf8da-8323-4773-ab52-453d47b0b06f","resolution":{"observed_at":"2026-07-09T15:26:18.890747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.145777Z","title":"cosformer: Rethinking softmax in attention","venue":null,"work_id":"a2f95d08-f064-4c05-90cd-aa5c61972861","year":2022},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:a889a7abe1ef4422a6d2b7263d1507cf7d95de6fd2a15b54c84808ad433413c9","observation_id":"5e76a1bc-4e38-4c18-bff8-8d4431f4fc33","resolution":{"observed_at":"2026-07-09T15:16:19.147021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.900476Z","title":"Radev, Pradeep Muthukrishnan, and Vahed Qazvinian","venue":null,"work_id":"ced553ab-c908-44ab-af4d-c5975ca864fd","year":2009},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:499e91caba1bae7518bc041ce08d0964ee1a77bed38d19b92ccea0fcf903090e","observation_id":"f6587053-a665-4270-a64b-1f707dcabc63","resolution":{"observed_at":"2026-07-09T15:26:18.901541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.115808Z","title":"Random features for large-scale kernel machines","venue":null,"work_id":"662c9ed9-3b53-4ee9-89ea-c6770471360b","year":2007},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:c401af7c08833813b7163dd5d0ddf6e5626e7d6a020808e6a54fce88d8b6a139","observation_id":"907892fb-0d91-4fb7-be2d-714c21007503","resolution":{"observed_at":"2026-07-09T15:16:19.117067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.846921Z","title":"Efficient content- based sparse attention with routing transformers","venue":null,"work_id":"b825f8cc-efae-48c1-9f7f-316ebdbba7df","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:41841954fb77de65d826017795168f4477e03caa4ebbc7012bc57f9d84b034bc","observation_id":"e1c15487-4fa1-4194-bf92-18bb40091f6d","resolution":{"observed_at":"2026-07-09T15:26:18.848074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d8791f33ab305b2e6da3f0edfc9cc3acd387fb8775579ae029fd7de22a45e384","observation_id":"93435d25-db93-479d-8e4f-1ab7fdc1df1a","resolution":{"observed_at":"2026-06-30T12:54:40.213982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.880608Z","title":"Fundamentals of recurrent neural network (rnn) and long short-term memory (lstm) network.Physica D: Nonlinear Phenomena, 2020","venue":null,"work_id":"0f25af1e-4006-4a7f-acbc-eca47c0b05ff","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:b908ee8c92359078d133a54314cb5c9d562fb4ded057a0638ce8556764e2338b","observation_id":"0e3be53c-06e4-410a-9080-e2415116c509","resolution":{"observed_at":"2026-07-09T15:26:18.881786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.891473Z","title":"Understanding the differences in foundation models: Attention, state space models, and recurrent neural networks","venue":null,"work_id":"08bfa577-e67d-4bc6-af3b-51771371c470","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:0ee89655f4f417428a0da12773fa2ee3551c50a41c8bce4359608b35fb71726f","observation_id":"0120c4fd-bc84-4f5b-a3b3-db5799952836","resolution":{"observed_at":"2026-07-09T15:26:18.892779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.898784Z","title":"Nonstationary sparse spectral permanental process","venue":null,"work_id":"c8dcc514-7fef-4518-98a1-cb842e795376","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d7f5c3a56f2e6f39f94411b6eb572ec36f45c3aa67264b210c08c71f22fe507e","observation_id":"ba51912e-fe65-4c6e-a19a-0ae50b72e66d","resolution":{"observed_at":"2026-07-09T15:26:18.899951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.867790Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":"0e6cac87-e32b-4b29-8e3c-d63ec540b292","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:1dc942d71cbc4fbc0a581fdd78dfe1916b85fbdebf4777eb9935f8ca118a52ca","observation_id":"c49e48d5-1eec-43e3-b58a-991e9ffebd4d","resolution":{"observed_at":"2026-07-09T15:26:18.868971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.863716Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"1f0543f0-4254-4a99-8c2d-cc86fa2e1e49","year":2017},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:76aab7d6883c871b7f90b318f7614f726782b8254afc501d9650d17a95a49e4a","observation_id":"6d0acc53-c805-4628-8c66-7ae47be3b79c","resolution":{"observed_at":"2026-07-09T15:26:18.865389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.865927Z","title":null,"venue":null,"work_id":"62c4e4c7-05ba-4839-a04e-953bf7a7135c","year":2018},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:60a48d6b4c8a4696b945431394b030c8b27ee3ac87575dc46f9338c36077e73a","observation_id":"95155659-de7f-4f1a-8b11-e6eb95efe953","resolution":{"observed_at":"2026-07-09T15:26:18.867067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.861727Z","title":"Yaglom.Correlation Theory of Stationary and Related Random Functions, Volume I: Basic Results","venue":null,"work_id":"53511811-4e20-4388-9dbc-40a6aff939e5","year":1987},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:ab71be1e226ec067a5458f1db0007fc5bbe17aaff4b98c5f8b6771a81f2e925a","observation_id":"34556e74-f894-4920-8ea7-3d9675d8e042","resolution":{"observed_at":"2026-07-09T15:26:18.862926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.855647Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"d449a755-2936-4a9d-a57f-312c6d7618ad","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:5c696149f2d349412a0d078a70c6b56f9eed0762998d2928a09a8459a21cfd76","observation_id":"8ddd0457-c472-4c89-b898-832cc173be0c","resolution":{"observed_at":"2026-07-09T15:26:18.856915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.869466Z","title":"The hedgehog & the porcupine: Expressive linear attentions with softmax mimicry","venue":null,"work_id":"14a3a926-1519-4e09-904e-240b22d7a9cc","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d90fd29fbc1683f3db54d70f7bde9cc8264bbf17de0ce5aa9c408ac6edb85b00","observation_id":"8221a407-aa3a-46d0-96e9-18225de193fd","resolution":{"observed_at":"2026-07-09T15:26:18.870897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.863166Z","title":"Good\" and 4,790","venue":null,"work_id":"847615b8-14a5-4011-833c-1760ac2975b1","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:ade2266fa0e268c188943a9528f7d6e6b8eddd47aa6da0e13045db381a86e078","observation_id":"c879bd4f-35b6-428a-a266-aa54cb44ef3b","resolution":{"observed_at":"2026-07-09T15:26:18.864269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T09:05:51.080730Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.27748."}