{"as_of":"2026-08-13T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb0eb009966de36bcbea31d6fa2c635aa41060a5eda97e7e6c80ec7e0fa1bf52","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:02:06.937137Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09468/citation-record","integrity":"/paper/2608.09468/integrity","json":"/paper/2608.09468/citation-record.json","paper":"/paper/2608.09468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.651371Z","title":"Attention is all you need.Proceedings of the 2017 Advances in Neural Information Processing Systems, NeuraIPS, pages 5998–6008, 2017","venue":null,"work_id":"c216432a-74bb-4710-b6da-c96589884a1f","year":2017},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.733397Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:375b4950bc1e21790dec8594ede060c3cc333728d3b0f42d732e81cf4673d704","observation_id":"7bd4a140-c4f3-4aca-8f13-fe8cf5344647","resolution":{"observed_at":"2026-08-11T17:02:07.657671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:02:06.739145Z","title":"Llama: open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.739145Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:45958db6f6ac8655fd18ce938ae912fccc35e8667300a51abd434b1e41846d63","observation_id":"2a19aaee-0952-4df1-9c0a-856f4aa08113","resolution":{"observed_at":"2026-08-11T17:02:06.739145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T17:02:06.744470Z","title":"Llama 2: open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.744470Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:129502b8dcd38ffb94086470eb6bd16ca016ef860ef9b45ebaf0d15f1ee135f3","observation_id":"f1eba3b0-f82b-450e-84bb-51e0e2505169","resolution":{"observed_at":"2026-08-11T17:02:06.744470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:06.749457Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.749457Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:8c34e570ed2b85dffc5caabe9f4832b9f41543245f30e2513eaf78ac8e3fb1f9","observation_id":"0fb668da-41b8-48ee-9f55-4115ea066474","resolution":{"observed_at":"2026-08-11T17:02:06.749457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.625879Z","title":"Molmo and pixmo: open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":"fd136ed2-a255-4dbd-afa3-5d78f273237b","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.755293Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:42400bf7409b468149db8c7a772733120be385cd9b979b6aa89b20b6e364bf1d","observation_id":"77a00a8d-2fa9-42c1-81bf-23e2aa35a402","resolution":{"observed_at":"2026-08-11T17:02:07.630860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-12T22:43:01.323456Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-11T17:02:06.760415Z","title":"Nvlm: open frontier-class multimodal llms.arXiv preprint arXiv:2409.11402, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.760415Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:d1ff13db660f4bce5b84fc55760209e17a5aea9ef12018ed32a7244cf79d5f2a","observation_id":"6a6a3153-d04c-4a01-aef2-f61433ec6a6b","resolution":{"observed_at":"2026-08-11T17:02:06.760415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.609978Z","title":"Efficient transformers: a survey.ACM Computing Survey, 55(6), 2022","venue":null,"work_id":"8a3cbe22-3b08-4fde-82db-7f2716824d47","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.767004Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:1a123cb0e29b345d09b331a812effe81077d3e1f356b209dc5cc9132af3a4b7c","observation_id":"c4a816df-d03b-4ba8-8028-3b5009247283","resolution":{"observed_at":"2026-08-11T17:02:07.615287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.593019Z","title":"A survey on efficient training of transformers","venue":null,"work_id":"ed3fc028-5cf7-4914-99da-b0f147813485","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.772520Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:7b02c95e348710249e2a71fccd5abbb16db5ac91d0a1374db69a2a2ab661f1b5","observation_id":"2f607eb3-f53f-4eee-b132-8c578e47b8de","resolution":{"observed_at":"2026-08-11T17:02:07.598109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.576746Z","title":null,"venue":null,"work_id":"da4045c3-7b97-43c3-af3d-5d79d28da683","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.777736Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:eaaf5d7844827c0292600b3b1177f54f0ae57d536209cb916d299b5489ac3246","observation_id":"e1c29fcc-6bc8-4563-a0c0-8ef0102c0970","resolution":{"observed_at":"2026-08-11T17:02:07.581779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.561426Z","title":"A survey on vision transformer.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(1):87–110, 2022","venue":null,"work_id":"573f0136-b981-4e18-9bd3-72edd9301cbb","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.783024Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:d4ff569927d25a0190f153a79adf0a830fe1251fbe4bb5f568489f34936f608b","observation_id":"1eb31702-f9b0-4ebf-b0f6-2acd135bf81d","resolution":{"observed_at":"2026-08-11T17:02:07.566504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.546206Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"656c46bc-e51e-474f-813c-fff9f261aafc","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.789114Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:548de9cff1ce875ca916c0a70f4a2f4d2109c9ab30f8d8f9e6a13cfff6b7ad3a","observation_id":"1df62038-dde7-43b7-b1fb-94f733cdd8a7","resolution":{"observed_at":"2026-08-11T17:02:07.551246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.529384Z","title":"Diagonal state spaces are as effective as structured state spaces","venue":null,"work_id":"1e5bf0d3-b6b0-4676-b63d-947ee98193e5","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.794479Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:938435d6083b296174bcb371ddd7dbd2f23d5f37339c96ba8d1e1ccf0b2fcb81","observation_id":"dfa9049a-e736-42ae-b409-4e28161aa6c2","resolution":{"observed_at":"2026-08-11T17:02:07.534221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.514214Z","title":null,"venue":null,"work_id":"84c898a1-16d8-4c56-8e68-af7c8168b0a4","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.799632Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:cd014ec9ea506c9638d73c37423f4290f07bd4a1aeaa4bd5beb89d9685206bba","observation_id":"5a49165a-d784-4664-b347-f09b3875177e","resolution":{"observed_at":"2026-08-11T17:02:07.519106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.498701Z","title":"Liquid structural state-space models","venue":null,"work_id":"9704d44f-8293-41ed-adfa-9045bdcb7e3a","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.804447Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:71b9714837a3f29d1d202e446df69e78ac0a6cc28073eee06fe95577cb580278","observation_id":"fedf7564-1b39-4c14-a9b6-39fad529bd22","resolution":{"observed_at":"2026-08-11T17:02:07.503407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.483470Z","title":"Simplified state space layers for sequence modeling","venue":null,"work_id":"121ec147-1713-41f3-835c-412bf44ddd43","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.809142Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:672cbc0ad6b22095b64f88031ee1d016808e0e70b0fc897daf0da0bae7dd7a59","observation_id":"7484d9bd-91c1-4cbc-97c9-821d3219d5db","resolution":{"observed_at":"2026-08-11T17:02:07.488124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-11T17:02:06.813888Z","title":"Retentive network: a successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.813888Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:26a88350458a42a26206d740cf5f42ea965ad9e53a86558ba3c9a9976c94454e","observation_id":"affa02d5-02da-4bd1-9626-0ad06068fbf0","resolution":{"observed_at":"2026-08-11T17:02:06.813888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.466843Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":"35b6e55e-c139-41fd-adbf-d3a331172c4c","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.818921Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:6669f10c343fe95a9eea000364d4f05d2642df0d6e7c125e6134cf58193d8dba","observation_id":"a4d0d1ab-6067-46f6-b07d-9b14f63f7418","resolution":{"observed_at":"2026-08-11T17:02:07.472604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.451058Z","title":"Transformers are rnns: fast autoregressive transformers with linear attention","venue":null,"work_id":"3894cfd4-802c-4df2-befe-17940712039b","year":2020},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.823323Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:4260109dd6e98fe5c6ad22a153d2f24d6607d30e4742ed1d92ee82f5175dbf9f","observation_id":"d97789cb-2202-4d0a-abf9-2067798803ac","resolution":{"observed_at":"2026-08-11T17:02:07.456246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.434787Z","title":"Efficient attention: attention with linear complexities","venue":null,"work_id":"e995222c-cc57-4d2e-906c-f446bbc650ce","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.827677Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:8d27976c612f2ec1b786269923de8815626557f2b3b685afeca04e130158422b","observation_id":"3efb5ef3-2a30-4674-972b-c354604964b1","resolution":{"observed_at":"2026-08-11T17:02:07.439782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.418944Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"d363ca53-2d03-4996-ba62-fc9e42699aed","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.832401Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:574c1daae570fb59030c40092448a7572e0df1264dfef75cc404e1abd8ef8379","observation_id":"7af4b9ed-8273-4831-8def-e00b15592c32","resolution":{"observed_at":"2026-08-11T17:02:07.423943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.403425Z","title":"Flatten transformer: vision transformer using focused linear attention","venue":null,"work_id":"d61514b7-4e65-4df7-80b5-77a2858b1a64","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.837260Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:49d19904e6f3fcf3c432cc53a8de3cd899da048f90692a0dbbf9202a14679f26","observation_id":"349fb060-3e53-4895-95f2-46bc8956a66f","resolution":{"observed_at":"2026-08-11T17:02:07.408559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.383449Z","title":"Polaformer: polarity-aware linear attention for vision transformers","venue":null,"work_id":"357f4542-2046-4df1-b249-09c61ab535f2","year":2025},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.841842Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:9290211f3fb0b2331a50350d41c20e7d1ea75402774444d356513322d1438665","observation_id":"902f38e1-f551-4875-817b-b88076078383","resolution":{"observed_at":"2026-08-11T17:02:07.389436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14902","last_updated":"2020-08-20T05:43:22Z","snapshot_observed_at":"2026-08-11T02:59:59.701652Z","submitted_at":"2020-07-29T15:18:46Z","title":"Linear Attention Mechanism: An Efficient Attention for Semantic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.14902","snapshot_observed_at":"2026-08-11T17:02:06.846478Z","title":"Linear attention mechanism: an efficient attention for semantic segmentation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.846478Z"},"links":{"cited_paper":"/paper/2007.14902","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:112e26a87948d714a2c7ab0d60da996dbc7ed2fc090c188ff1b05050e5777f8f","observation_id":"e04374ce-f3de-4284-ac12-4545da574cf5","resolution":{"observed_at":"2026-08-11T17:02:06.846478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.364895Z","title":"Random feature attention","venue":null,"work_id":"14f8f7c1-8936-4ebb-aaf4-df9b4630e51a","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.851757Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:b7a48853b20523cf33e5d4197fb8aa6454a59b855645f5753f81d18c899963f5","observation_id":"ec9b2a3f-6171-4bbc-836e-9a14c1f6e354","resolution":{"observed_at":"2026-08-11T17:02:07.370028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.348817Z","title":"Rethinking attention with performers","venue":null,"work_id":"204dc314-4d36-45ee-b5df-5a4c6b56f12d","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.856505Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:c5a944855148b363a1c1676a98ddd98901c2f658dd890ad2de0bbb3a71b50077","observation_id":"df083ca3-9ea6-4d5e-8adb-151c05bc334b","resolution":{"observed_at":"2026-08-11T17:02:07.354293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.332213Z","title":"Mamba: linear-time sequence modeling with selective state spaces","venue":null,"work_id":"c0ef96d2-12b0-4b48-882c-5d0dcb548315","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.861100Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:4c0b9579533becf669a77db81364824619ac0518051772d420c0b50628db6d5c","observation_id":"207c6656-18d6-4fc9-ab07-ec9c10cf617b","resolution":{"observed_at":"2026-08-11T17:02:07.337411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.316645Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"4881e54c-260e-4770-9281-817ecc9f4188","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.865999Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:1f00d3c7b4b2f5a99a60ff83d9bd76d0315c1e96344e6a6e7c403427e80a2212","observation_id":"6bcdf29d-0268-42a2-936e-30e01f8fa144","resolution":{"observed_at":"2026-08-11T17:02:07.321854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14103","last_updated":"2021-09-21T18:04:55Z","snapshot_observed_at":"2026-08-12T10:40:58.838350Z","submitted_at":"2021-05-28T20:45:30Z","title":"An Attention Free Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14103","snapshot_observed_at":"2026-08-11T17:02:06.870460Z","title":"An attention free transformer.arXiv preprint arXiv:2105.14103, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.870460Z"},"links":{"cited_paper":"/paper/2105.14103","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:58baf7926fc05789b73334148a63d73363df7f376718378b816fa31cef6e8e45","observation_id":"b3b9a948-da53-456b-918c-639b4a1da352","resolution":{"observed_at":"2026-08-11T17:02:06.870460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.299774Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":"3fdfbc51-bf35-4639-b01e-c8c1f49f283a","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.875703Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:1999a15a7e859c251dbde69f1c659faac4f81a546c29fc7067db0c834fd3f6fd","observation_id":"366b724a-9899-4afc-89e5-c6030e9a6aa5","resolution":{"observed_at":"2026-08-11T17:02:07.305242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:06.880665Z","title":"Group normalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.880665Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:923c508c4f3636a6aeb04eb0dfdad96efbc2e292c33682ec5a64567dbc58672a","observation_id":"e551ac0a-a7a5-42e3-954b-488100443664","resolution":{"observed_at":"2026-08-11T17:02:06.880665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14756","last_updated":"2024-02-06T02:57:35Z","snapshot_observed_at":"2026-08-12T19:16:05.727816Z","submitted_at":"2022-05-29T20:07:23Z","title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14756","snapshot_observed_at":"2026-08-11T17:02:06.885235Z","title":"Efficientvit: enhanced linear attention for high-resolution low-computation visual recognition.arXiv preprint arXiv:2205.14756, 3(1), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.885235Z"},"links":{"cited_paper":"/paper/2205.14756","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:dfe064bde7451b02933bdc09926999d1a7a5df4f759b6e285cad57daad973317","observation_id":"fded8756-0e96-4f2e-b5e6-fe98c74c77b2","resolution":{"observed_at":"2026-08-11T17:02:06.885235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.268195Z","title":"Soft: softmax-free transformer with linear complexity.Proceedings of the 2021 Advances in Neural Information Processing Systems, NeuraIPS, 34:21297–21309, 2021","venue":null,"work_id":"1998f5aa-0ceb-447f-a3b3-ad12a52436c6","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.890292Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:7ea252e2f7fd59a5c8443102d882b735b57b52f47e54797854ed2bf815e6244e","observation_id":"dd78c79f-08f4-42e2-ae0f-67a5679d4a35","resolution":{"observed_at":"2026-08-11T17:02:07.274337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.248609Z","title":"Nystr¨omformer: a nystr ¨om-based algorithm for approximating self-attention","venue":null,"work_id":"f545feef-1a2a-4578-a4de-c75598213004","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.895575Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:b7b82be59290e7d75246cf9ac0a364dba89117215f814485a4223541f0b11c94","observation_id":"f91b6789-a3d1-4e26-9a39-a2b67165695a","resolution":{"observed_at":"2026-08-11T17:02:07.254217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.230564Z","title":"Outrageously large neural networks: the sparsely-gated mixture-of-experts layer","venue":null,"work_id":"a949d942-4915-4308-ad3d-142e3a98395a","year":2017},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.900238Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:31d8d0a2b100e2f9d1474b70d65b612df34b566aa57f7c71051c9433ffab7677","observation_id":"594cde54-6c43-4f90-abf2-a79a4cdf328c","resolution":{"observed_at":"2026-08-11T17:02:07.236513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.211161Z","title":"Don’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization","venue":null,"work_id":"1d6b4ca7-0a99-424f-8622-b8d3cf7c95c5","year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.904806Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:d0fc87cc9b64b375550a4007f70e12a12c441ef478667b0c9901823cd8e6203a","observation_id":"11156257-0005-4f0a-aff0-29a3e7c52132","resolution":{"observed_at":"2026-08-11T17:02:07.217429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.192829Z","title":"Long range arena: a benchmark for efficient transformers","venue":null,"work_id":"c81e48fb-848f-4f84-8dfb-49e88ac08c49","year":2020},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.909593Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:92d01aa6a32578e5d96829691c1a8d7e00adca25bfd518d3bdbea35c03b19365","observation_id":"12c2d22a-8cee-4abb-9529-43cf6d45b9cb","resolution":{"observed_at":"2026-08-11T17:02:07.198005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.173820Z","title":"Listops: a diagnostic dataset for latent tree learning","venue":null,"work_id":"512d8f55-ab2b-4b58-bf77-93ab8d90c25c","year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.914154Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:57970b1917b7616fad3b6585b2594ae7b07485b6f4f3b1c874a2fed0c199a82d","observation_id":"985d0c57-9069-4181-bcf6-3803bf82d05e","resolution":{"observed_at":"2026-08-11T17:02:07.180622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.156915Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":"9cd2a4d0-af28-464d-afcf-f15abcc4340e","year":2011},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.918732Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:ac74abf5d81560f126d11c05ebe551b03327b7dfe074176951da6ba8b1be426c","observation_id":"b2114500-42d9-4d0a-8f99-32bfeb3f4060","resolution":{"observed_at":"2026-08-11T17:02:07.162071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.141162Z","title":"The acl anthology network corpus.Language Resources and Evaluation, 47(4):919–944, 2013","venue":null,"work_id":"2963161d-2081-4046-ae66-5fd658cff627","year":2013},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.923391Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:5c22300ca311765202dfa6cdc64fada03b0968adbe1ba55bb5d32c2516bf4879","observation_id":"e8449253-7c69-42bd-b3e2-7f360bc81a69","resolution":{"observed_at":"2026-08-11T17:02:07.146128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.123163Z","title":"Learning long-range spatial dependencies with horizontal gated recurrent units.Proceedings of the 2018 Advances in Neural Information Processing Systems, NeuraIPS, 31, 2018","venue":null,"work_id":"d00b34f7-f866-47d4-9677-1547a1bed064","year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.927739Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:b908f9818850419877f042d7b73aa813b6cfa05798b0767f67a682ebad106bb3","observation_id":"a66fb356-0427-48a0-ba50-37fff294600b","resolution":{"observed_at":"2026-08-11T17:02:07.128493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:06.932524Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.932524Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:2e20aa7f880a9f771c2eb9372571d57ed98dfb7d7a5446f29dfd34696dd86bc9","observation_id":"867a0f1f-591f-4288-9ec6-cfd59ae19a5d","resolution":{"observed_at":"2026-08-11T17:02:06.932524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.094347Z","title":"Emnist: Extending mnist to handwritten letters","venue":null,"work_id":"67988ea5-e600-4b7b-b44d-dbabaef0d2e7","year":2017},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.937137Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:66d6f1a5e9c50271a6bf57022e3640ad8abf543d950d2ab51b946f5bb8065aba","observation_id":"12adb45a-901c-4675-b703-276e1affadcb","resolution":{"observed_at":"2026-08-11T17:02:07.101239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T00:15:40.993338Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2608.09468."}