{"as_of":"2026-08-22T07:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c679b9df875ef5f278fa1a7cd49fa8cd7632e156d571e82e0a8a3371c1ee3658","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:58:23.967907Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:29:02.457697Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"cited_work":{"arxiv_id":"2504.19561","doi":"10.48550/arxiv.2504.19561","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"N., Tumma, N., Thomas, A","venue":"ArXiv.org","work_id":"136c5e39-3a9f-4eb3-9d86-084fb0779533","year":2025},"citing_paper":{"arxiv_id":"2604.21100","last_updated":"2026-04-22T21:38:25Z","snapshot_observed_at":"2026-08-02T18:50:20.662385Z","submitted_at":"2026-04-22T21:38:25Z","title":"Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T00:19:24.366922Z"},"links":{"cited_paper":"/paper/2504.19561","citing_paper":"/paper/2604.21100"},"observation_digest":"sha256:cd3a9372bd87d15f835135c9d9c3bc83f234eb81294ae91077692798b50a4b23","observation_id":"55afe2d5-25e1-4f90-87ab-9897891338d2","resolution":{"observed_at":"2026-05-10T00:19:46.619416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"cited_work":{"arxiv_id":"2504.19561","doi":"10.48550/arxiv.2504.19561","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"N., Tumma, N., Thomas, A","venue":"ArXiv.org","work_id":"136c5e39-3a9f-4eb3-9d86-084fb0779533","year":2025},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2504.19561","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:89b3089c4d917cc1adf9c26d835558ee575292721593531fe3520756e166c78a","observation_id":"5350e92b-5a6f-44dd-b27b-93e712158e70","resolution":{"observed_at":"2026-06-28T23:32:46.743562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19561/citation-record","integrity":"/paper/2504.19561/integrity","json":"/paper/2504.19561/citation-record.json","paper":"/paper/2504.19561"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:21.806841Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:21.806841Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:2f378d606ed8d7fde4fe2c7eb934ca3d455820fb7bce2f9dfc529d45ac9b9220","observation_id":"f3865c88-51f1-4e6c-b53b-6da7537a7bab","resolution":{"observed_at":"2026-08-16T05:58:21.806841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-08-14T07:01:16.499526Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-16T05:58:21.872146Z","title":"and Zuidema, W","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:21.872146Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:e3c69ad307ba9334e6bbc91e2b0df7a87d90413262b9aa22c03a0f1e51763a9c","observation_id":"5f31c8a7-7e4c-40e9-b9d9-8c6f4db37630","resolution":{"observed_at":"2026-08-16T05:58:21.872146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:21.973861Z","title":"Stochastic theory of minimal realization","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:21.973861Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:84f17c8b0a22ff3126abe5939c63a2edbb5d18804252a0b8d013fac77de67d1f","observation_id":"298aed03-ac8c-4dc4-889e-54ede1686ef4","resolution":{"observed_at":"2026-08-16T05:58:21.973861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12973","last_updated":"2024-01-30T18:59:34Z","snapshot_observed_at":"2026-08-18T18:41:48.541535Z","submitted_at":"2024-01-23T18:59:21Z","title":"In-Context Language Learning: Architectures and Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12973","snapshot_observed_at":"2026-08-16T05:58:21.997591Z","title":"In-context language learning: Architectures and algorithms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:21.997591Z"},"links":{"cited_paper":"/paper/2401.12973","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:dafaca68c83edd378aae7c6195d128ebe4e30ad876dc677bcb2ce539155a66a6","observation_id":"9064800c-cd64-4f69-9002-fdc7e583b64a","resolution":{"observed_at":"2026-08-16T05:58:21.997591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01590","last_updated":"2024-03-31T14:31:14Z","snapshot_observed_at":"2026-08-16T14:13:18.547869Z","submitted_at":"2024-03-03T18:58:21Z","title":"The Hidden Attention of Mamba Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01590","snapshot_observed_at":"2026-08-16T05:58:22.003964Z","title":"The hidden attention of mamba models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.003964Z"},"links":{"cited_paper":"/paper/2403.01590","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:50bf3c4eb283723b88f76bef91948d0a6ff78b4398aac8ee1f8ac0672452467a","observation_id":"f5f02e5e-d6c3-4e62-9b56-de612b6fdc71","resolution":{"observed_at":"2026-08-16T05:58:22.003964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-16T14:02:46.982560Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-16T05:58:22.011204Z","title":"and Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.011204Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:1b9c1933edd81910f6a110b8089ef4a9ddcd25bbbb9aa480b235d86a5301c092","observation_id":"d5f50f86-bf7c-487d-8c0e-88e89bcdd8e6","resolution":{"observed_at":"2026-08-16T05:58:22.011204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01781","last_updated":"2024-07-03T11:20:43Z","snapshot_observed_at":"2026-08-18T18:45:01.785556Z","submitted_at":"2024-02-01T19:12:25Z","title":"When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01781","snapshot_observed_at":"2026-08-16T05:58:22.018300Z","title":"A., Alnumay, Y., Alrashed, S., Alsubaie, S., Almushaykeh, Y., Mirza, F., Alotaibi, N., Altwairesh, N., Alowisheq, A., Bari, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.018300Z"},"links":{"cited_paper":"/paper/2402.01781","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:a4713cde3ef08e77441d8fd923fa51dee6535a3aa197a7a9f88a9a0c9e60c0e3","observation_id":"3d6a5638-e8f3-4e0e-9d76-0c8b5cbfff94","resolution":{"observed_at":"2026-08-16T05:58:22.018300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-16T14:36:34.764352Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-08-16T05:58:22.026407Z","title":"Zoology: Measuring and improving recall in efficient language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.026407Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:81f8160983e19ab27a06a44d49064ef616acc1d47afe0029572f5babc510806c","observation_id":"18ce4659-008c-4b74-92c1-2df2f6a37e25","resolution":{"observed_at":"2026-08-16T05:58:22.026407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-16T14:14:23.399336Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-16T05:58:22.103593Z","title":"Simple linear attention language models balance the recall-throughput tradeoff, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.103593Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:1f693f7501a4c5385019bce53ba6189024ac67b090769646f21ed1c5f599c653","observation_id":"3a105404-ab9c-4a06-9e11-d843e60f241c","resolution":{"observed_at":"2026-08-16T05:58:22.103593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.06258","last_updated":"2016-12-05T00:14:01Z","snapshot_observed_at":"2026-08-14T21:34:24.738771Z","submitted_at":"2016-10-20T01:03:20Z","title":"Using Fast Weights to Attend to the Recent Past","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.06258","snapshot_observed_at":"2026-08-16T05:58:22.177814Z","title":"Z., and Ionescu, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.177814Z"},"links":{"cited_paper":"/paper/1610.06258","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:a5c59c512110a08d567ad7d0f75599b8b74f224eaf1c25d85a63a1b7e5745dea","observation_id":"65e9fe45-6fdd-4cd8-b920-fc0bb3957590","resolution":{"observed_at":"2026-08-16T05:58:22.177814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.507045Z","title":null,"venue":null,"work_id":"b61fb573-c36a-4ae0-98df-f9b854c0227c","year":1992},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.215433Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:c47d23563c51bbf484823ede11869df8d81be68c53a01a108f95e9d88e5f660d","observation_id":"ff4d40ff-54d4-429e-8e32-aed83ab148d3","resolution":{"observed_at":"2026-08-16T05:58:26.513446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03016","last_updated":"2023-10-04T17:57:33Z","snapshot_observed_at":"2026-08-16T14:55:02.136822Z","submitted_at":"2023-10-04T17:57:33Z","title":"Understanding In-Context Learning in Transformers and LLMs by Learning to Learn Discrete Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03016","snapshot_observed_at":"2026-08-16T05:58:22.219962Z","title":"Understanding in-context learning in transformers and llms by learning to learn discrete functions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.219962Z"},"links":{"cited_paper":"/paper/2310.03016","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:48e7505ac88d0b8f92fe343503a481dd8ee243640bcdb1442e2d2527518265f6","observation_id":"7a2c7354-354e-4573-b690-7d0f7a6de6e3","resolution":{"observed_at":"2026-08-16T05:58:22.219962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07028","last_updated":"2020-02-17T16:16:40Z","snapshot_observed_at":"2026-08-19T04:00:30.095640Z","submitted_at":"2020-02-17T16:16:40Z","title":"Low-Rank Bottleneck in Multi-head Attention Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07028","snapshot_observed_at":"2026-08-16T05:58:22.225846Z","title":"S., Reddi, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.225846Z"},"links":{"cited_paper":"/paper/2002.07028","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:86eddb417c2e6f41e6ca592b4017841aef8c98d26524b1b9d11e9c94ab63fa17","observation_id":"96bec6c7-381b-4510-b8ec-d540c0c4ab36","resolution":{"observed_at":"2026-08-16T05:58:22.225846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10189","last_updated":"2025-02-08T20:53:16Z","snapshot_observed_at":"2026-08-18T18:45:02.408021Z","submitted_at":"2024-08-19T17:48:11Z","title":"Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10189","snapshot_observed_at":"2026-08-16T05:58:22.232550Z","title":"Y., Xing, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.232550Z"},"links":{"cited_paper":"/paper/2408.10189","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:cf7ddc7f938e5416183d058cc4f3d3211ed76f48bfb0e46e04194eaa3e0a0aa4","observation_id":"508a8e6e-da07-422b-b029-35fcfc7f24c2","resolution":{"observed_at":"2026-08-16T05:58:22.232550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:22.238310Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.238310Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:7d5ce6aa93a03acc5861b9775fccf927546cf72c53c1c00568c691cc0c7affab","observation_id":"fb8effd7-8e51-4462-96de-8dd11e260ddb","resolution":{"observed_at":"2026-08-16T05:58:22.238310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.488344Z","title":"Linear System Theory and Design","venue":null,"work_id":"c12f74ac-2cff-4984-ad74-5af76b5fc6c0","year":1998},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.269045Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:fea344a05a656f5818a11121c1788062f49321c1db6dadec494f13444e8e7ad6","observation_id":"3c48da62-3147-417e-9876-502b6b805360","resolution":{"observed_at":"2026-08-16T05:58:26.494105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-16T05:58:22.346222Z","title":"and Gu, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.346222Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:4b2d339cb46dd517be54ea20c6ad0cdd9d00d9d52b724b2036f0f625b2674121","observation_id":"261229f5-e88b-448d-ba28-b325083b57c1","resolution":{"observed_at":"2026-08-16T05:58:22.346222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-08-20T11:13:49.127921Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T05:58:22.403929Z","title":"L., Fernando, A., Botev, A., Cristian-Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y., Srinivasan, S., Desjardins, G., Doucet, A., Budden, D., Teh, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.403929Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:b1216020e6c488d69f3c68b887f3b0dff1ab5e8f49aa27a9185afcf26a711073","observation_id":"0fa4d082-08dd-4cc4-90f1-f21da8c1df1d","resolution":{"observed_at":"2026-08-16T05:58:22.403929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.468790Z","title":"and van der Veen, A","venue":null,"work_id":"07fd4ded-33a7-4987-92e1-62986b23cb7b","year":1998},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.420038Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:572bd8fc59b22b1838390fd40130be96c726531294519434a59bd17779dd4f68","observation_id":"a498db1f-0208-4a72-8b46-31452e6c3dfc","resolution":{"observed_at":"2026-08-16T05:58:26.475066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03404","last_updated":"2023-08-01T14:27:08Z","snapshot_observed_at":"2026-08-16T18:41:06.754883Z","submitted_at":"2021-03-05T00:39:05Z","title":"Attention is Not All You Need: Pure Attention Loses Rank Doubly Exponentially with Depth","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03404","snapshot_observed_at":"2026-08-16T05:58:22.426444Z","title":"Attention is not all you need: Pure attention loses rank doubly exponentially with depth, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.426444Z"},"links":{"cited_paper":"/paper/2103.03404","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:340df344274bb5f4b84d7b3f2a0df22410cf70e1ead60a27a953169f015a5ebf","observation_id":"ad60ffc0-f7b3-41d0-92cd-98b69c53733d","resolution":{"observed_at":"2026-08-16T05:58:22.426444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01681","last_updated":"2019-10-26T15:37:14Z","snapshot_observed_at":"2026-08-18T19:19:29.022473Z","submitted_at":"2019-04-02T21:50:34Z","title":"Augmented Neural ODEs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01681","snapshot_observed_at":"2026-08-16T05:58:22.506652Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.506652Z"},"links":{"cited_paper":"/paper/1904.01681","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:d98be2e9001243feee561117b11008cb93829d924b16d2615801c0e05c604054","observation_id":"a5a0b2d2-c0f0-49c4-9448-80fe8a58df4a","resolution":{"observed_at":"2026-08-16T05:58:22.506652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:22.537357Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.537357Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:6de8afba079fd9a44b5e5cb5348062f6cb97783d29eaa56bc0ac7c9484e8bb87","observation_id":"ce426964-76f1-42be-9e66-c9b7f49b228a","resolution":{"observed_at":"2026-08-16T05:58:22.537357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-08-18T19:17:21.619873Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-16T05:58:22.542685Z","title":"Y., Dao, T., Saab, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.542685Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:6bcf2db878671156838ae44185d0a77365664ca667707a3a198a204002f72a1a","observation_id":"eca2b1a5-086e-49a4-8197-0b2c1877e5c8","resolution":{"observed_at":"2026-08-16T05:58:22.542685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/00207729008910366","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:24.242012Z","title":"and Juang, J.-N","venue":null,"work_id":"cfb4b739-cb2d-4237-a4db-ad307fedde60","year":1990},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.548107Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:b26159b9230faef930a88f72dc1fc49bfb9153714c1f558108bbbe882b834b1d","observation_id":"f0efbf33-3db2-4fdc-8378-26176d198f94","resolution":{"observed_at":"2026-08-16T05:58:24.273112Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-16T05:58:22.554355Z","title":"Zamba: A compact 7b ssm hybrid model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.554355Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:540af0ce18fb1afc6c20f112423d86d0a97f842b0bfd6dae122be3fe6e510f20","observation_id":"3d0686c8-79b8-4cb1-ad91-0e6fd608ab52","resolution":{"observed_at":"2026-08-16T05:58:22.554355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:22.562574Z","title":"and Bengio, Y","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.562574Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:4f4bde789ab451c365d889bd2afe65152a1f6f589e89df4f8219a948c5d04700","observation_id":"8a8225d3-9185-4933-920d-6337f441e113","resolution":{"observed_at":"2026-08-16T05:58:22.562574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T05:58:22.622868Z","title":"and Dao, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.622868Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:500414009b72e939f138f0ec3b6ca15af72a23997118e7d52d33e7ceb90b6708","observation_id":"1475bf26-17eb-47ae-92fb-e5dfb8655a7b","resolution":{"observed_at":"2026-08-16T05:58:22.622868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-16T05:58:22.673184Z","title":"Efficiently modeling long sequences with structured state spaces, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.673184Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:26a0db51d2324a42cc0149527b8f412790c67e0416ccf77514e7223dc0eae1ee","observation_id":"7fb5d34d-f589-4a61-bca9-853c28495e7b","resolution":{"observed_at":"2026-08-16T05:58:22.673184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11893","last_updated":"2022-08-05T17:02:29Z","snapshot_observed_at":"2026-08-16T16:50:48.397872Z","submitted_at":"2022-06-23T17:58:39Z","title":"On the Parameterization and Initialization of Diagonal State Space Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11893","snapshot_observed_at":"2026-08-16T05:58:22.703568Z","title":"On the parameterization and initialization of diagonal state space models, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.703568Z"},"links":{"cited_paper":"/paper/2206.11893","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:002ef5e19ba33da48f0be27430f338aace2a12fdeea852e79a9b838e292bcc75","observation_id":"dc70b5e6-007d-49ff-8086-144bf1262750","resolution":{"observed_at":"2026-08-16T05:58:22.703568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12951","last_updated":"2022-09-26T18:37:13Z","snapshot_observed_at":"2026-08-18T18:45:01.208964Z","submitted_at":"2022-09-26T18:37:13Z","title":"Liquid Structural State-Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.12951","snapshot_observed_at":"2026-08-16T05:58:22.719675Z","title":"Liquid structural state-space models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.719675Z"},"links":{"cited_paper":"/paper/2209.12951","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:9e3ae22ced10004477aa0d2e5b2649b9afa3b91ee86f01ed14aa747d9f2a10c3","observation_id":"8a9ab19c-dd64-46e9-8937-071553669d13","resolution":{"observed_at":"2026-08-16T05:58:22.719675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T05:58:22.725272Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.725272Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:2e5e227720178a214eb54c563129ed085712f53d50dd30f33658870c2c0135bd","observation_id":"b194dc0d-158c-49b2-bff5-b8bea726b8e6","resolution":{"observed_at":"2026-08-16T05:58:22.725272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:22.730563Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.730563Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:fa1a008e587b09d9aa8e4e030cb22659bb50a4f5ccde81e55306bbff45b8211a","observation_id":"bef55f7f-ad44-4685-8c89-8e8160ac18af","resolution":{"observed_at":"2026-08-16T05:58:22.730563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:22.811951Z","title":"and Schmidhuber, J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.811951Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:2329e5f0b5746b1ae4ed50496f25355f7fcfe2258af986f362369ac9a6c5f9f8","observation_id":"c9d1d56f-207f-4abc-a0cd-7e25b9afc12b","resolution":{"observed_at":"2026-08-16T05:58:22.811951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-16T05:58:22.896981Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.896981Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:7b5b3fec1e29e3c8aa3a81b43f2436febfbe540be411e88b8c0b7526f0e71791","observation_id":"f84f8553-6cce-4013-b6d8-b7fef7d96a1c","resolution":{"observed_at":"2026-08-16T05:58:22.896981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-18T00:51:28.727325Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-16T05:58:22.930267Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.930267Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:070a844774f2e136813ab4c90569efb2c0b2130f25899ef768c06bb92c1d5e7e","observation_id":"ddc612ac-8d82-4907-b004-d9e130be441a","resolution":{"observed_at":"2026-08-16T05:58:22.930267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03554","last_updated":"2019-05-09T11:52:10Z","snapshot_observed_at":"2026-08-14T16:34:58.146653Z","submitted_at":"2019-05-09T11:52:10Z","title":"1D Convolutional Neural Networks and Applications: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03554","snapshot_observed_at":"2026-08-16T05:58:22.939662Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.939662Z"},"links":{"cited_paper":"/paper/1905.03554","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:ec4dbd186a56c3532be0e730fcb231a36c1d4ba8913dadaaa46eb14c5e294ac3","observation_id":"ee190d5a-3038-4839-87ec-5264e1c73eb0","resolution":{"observed_at":"2026-08-16T05:58:22.939662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-16T05:58:23.004976Z","title":"Jamba: A hybrid transformer-mamba language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.004976Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:c95c044f5aa2d50e69292a165a065f4e59c1a2fb0549d3e1d46724ef661e804b","observation_id":"0aa4e30e-0fc1-49af-9171-29d9e778c53b","resolution":{"observed_at":"2026-08-16T05:58:23.004976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/0317028","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:24.174373Z","title":"and Picci, G","venue":null,"work_id":"ba8b5e40-875f-4472-9cb3-852b91c196fd","year":1979},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.067261Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:8bb568c559b8662969c4197975a06b960b7fa83fa4bd376209c379466d7b4a81","observation_id":"e7b18125-b4a4-43f9-810f-c38772faa455","resolution":{"observed_at":"2026-08-16T05:58:24.180245Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.321806Z","title":"System Identification: Theory for the User","venue":null,"work_id":"f070447b-3130-4d2a-987e-f13ed8da29da","year":1999},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.125567Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:1c67a9b85afea9b3e8e2eb7eabb94cc53b2a3c161c8de0c3ada134e75c7bcfb6","observation_id":"65af2bc4-31bc-49d6-a5a5-5c6669f14a24","resolution":{"observed_at":"2026-08-16T05:58:26.413704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T05:58:23.166322Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.166322Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:75307ccc2aa3f91cc82fcc96f001f1f79027aa389e78de5f5aa29da7879fedbf","observation_id":"6d394a66-5962-4f39-8feb-254a7b70d0b6","resolution":{"observed_at":"2026-08-16T05:58:23.166322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.121893Z","title":null,"venue":null,"work_id":"36dfc5de-49b1-443b-818d-44ea0f2dc91d","year":1994},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.171613Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:14ac1acabb8c8787ec8c8f04a87feb0eb493f4ae5e9e5f30b52138f7bc2d8527","observation_id":"c40e8716-c8c9-44ac-bbd8-a835db48af5f","resolution":{"observed_at":"2026-08-16T05:58:26.231202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.04057","last_updated":"2018-02-22T05:38:25Z","snapshot_observed_at":"2026-08-18T20:23:41.249613Z","submitted_at":"2017-09-12T20:52:22Z","title":"Parallelizing Linear Recurrent Neural Nets Over Sequence Length","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.04057","snapshot_observed_at":"2026-08-16T05:58:23.176681Z","title":"and Cundy, C","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.176681Z"},"links":{"cited_paper":"/paper/1709.04057","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:f55e7d1652a75fc66d42a61d63a37aff15e135f893eb3dd716fc39670f08736c","observation_id":"e5299c07-5981-41fc-a822-bcdc62ff7054","resolution":{"observed_at":"2026-08-16T05:58:23.176681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08071","last_updated":"2021-01-11T14:40:32Z","snapshot_observed_at":"2026-08-18T18:41:20.256797Z","submitted_at":"2020-02-19T09:14:46Z","title":"Dissecting Neural ODEs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08071","snapshot_observed_at":"2026-08-16T05:58:23.182078Z","title":"Dissecting neural odes, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.182078Z"},"links":{"cited_paper":"/paper/2002.08071","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:3ca829d8feb38b6f684b9f378f816a12ae4af230115e08a3c42be75fda56fed9","observation_id":"b1398e03-0ec9-4b18-b53f-db87054b3a1e","resolution":{"observed_at":"2026-08-16T05:58:23.182078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18780","last_updated":"2023-10-28T18:40:03Z","snapshot_observed_at":"2026-08-20T19:41:32.053193Z","submitted_at":"2023-10-28T18:40:03Z","title":"Laughing Hyena Distillery: Extracting Compact Recurrences From Convolutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18780","snapshot_observed_at":"2026-08-16T05:58:23.187530Z","title":"Y., Kumbong, H., Parnichkun, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.187530Z"},"links":{"cited_paper":"/paper/2310.18780","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:41c7b2725fb724923e8050e00a3a31c2ceaf866bb1d57d5ba110279873fc22bb","observation_id":"0ca96cf8-82bc-4df1-b96d-593d8245269f","resolution":{"observed_at":"2026-08-16T05:58:23.187530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.074855Z","title":"and Li, Z","venue":null,"work_id":"97faf533-835e-4b3b-b760-2633c2f0c5dc","year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.233984Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:41f96471d0a093409cae31fba4e57b12c124997eb535bb201cda7f1091bff4d7","observation_id":"b701db1c-0598-449f-b425-c9eac04123b9","resolution":{"observed_at":"2026-08-16T05:58:26.079927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.056454Z","title":"In-context learning and induction heads","venue":null,"work_id":"35dad4ca-9a7a-4c76-aadb-00ec631dca04","year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.292675Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:c21ef9c2080154386b6317a8baa17eea8515551b239e29e7a87175ed2212b9e9","observation_id":"c02fdb83-5789-4a6c-a866-1ce6547e41cc","resolution":{"observed_at":"2026-08-16T05:58:26.063376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:26.037401Z","title":"In-context learning and induction heads","venue":null,"work_id":"e223a972-ada1-4d62-abbe-4308b51b0b72","year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.329361Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:ab542c09b6ea2cc9dfb9ab1901a36ef551243738bfdfd67d1c7aec43c7a79a07","observation_id":"deec9e76-8942-4e6b-9fd0-a9604f37eb5f","resolution":{"observed_at":"2026-08-16T05:58:26.043474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:25.907678Z","title":"V., Willsky, A","venue":null,"work_id":"2f728103-e2eb-4eb5-9017-361bfcf9e5f7","year":1996},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.363959Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:3c5b7bf5725e622fafecd4405234f4f589c7804434c7eb5c0ab5d31882529d91","observation_id":"44e62d16-26a3-4883-9bc1-55b03a56dc2c","resolution":{"observed_at":"2026-08-16T05:58:26.023229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06349","last_updated":"2023-03-11T08:53:11Z","snapshot_observed_at":"2026-08-16T15:49:03.576715Z","submitted_at":"2023-03-11T08:53:11Z","title":"Resurrecting Recurrent Neural Networks for Long Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06349","snapshot_observed_at":"2026-08-16T05:58:23.376046Z","title":"L., Gu, A., Fernando, A., Gulcehre, C., Pascanu, R., and De, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.376046Z"},"links":{"cited_paper":"/paper/2303.06349","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:f5adf9abec0db843d76e60e99e6df16e8982c6b9913418ab4b7005fa23a1bf25","observation_id":"7f9f91c7-d205-4289-af5a-fff2cb27ab47","resolution":{"observed_at":"2026-08-16T05:58:23.376046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06147","last_updated":"2024-06-02T02:48:05Z","snapshot_observed_at":"2026-08-18T07:38:48.627651Z","submitted_at":"2024-05-10T00:06:02Z","title":"State-Free Inference of State-Space Models: The Transfer Function Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06147","snapshot_observed_at":"2026-08-16T05:58:23.423047Z","title":"N., Massaroli, S., Moro, A., Smith, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.423047Z"},"links":{"cited_paper":"/paper/2405.06147","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:41c0edac61853dee0a5be7495cdf9de258e4a8e1f9634bd51933ae5929ad90d9","observation_id":"cd2dbba4-bffb-4433-af02-39ecfc922253","resolution":{"observed_at":"2026-08-16T05:58:23.423047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.5063","last_updated":"2013-02-16T00:35:48Z","snapshot_observed_at":"2026-08-15T08:47:13.449851Z","submitted_at":"2012-11-21T15:40:11Z","title":"On the difficulty of training Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.5063","snapshot_observed_at":"2026-08-16T05:58:23.442459Z","title":"On the difficulty of training recurrent neural networks, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.442459Z"},"links":{"cited_paper":"/paper/1211.5063","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:4fc0e2607673babcfc6ccf141f1b8375ea3c05e778ba2c7fee8bc5805f5715a7","observation_id":"613a4d29-7125-4bc9-a04c-786f2a4ef442","resolution":{"observed_at":"2026-08-16T05:58:23.442459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:25.743992Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":"5a6f9233-152a-410c-8534-8261d4b24141","year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.480994Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:41a3a3a0fef8b1665b728858b5ed3a192f4b471b7f1508f736d5c012375f67e5","observation_id":"8e5da019-8ff4-471a-91e4-0ee41abf773d","resolution":{"observed_at":"2026-08-16T05:58:25.803767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10866","last_updated":"2023-04-19T20:08:39Z","snapshot_observed_at":"2026-08-16T15:53:46.019050Z","submitted_at":"2023-02-21T18:29:25Z","title":"Hyena Hierarchy: Towards Larger Convolutional Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10866","snapshot_observed_at":"2026-08-16T05:58:23.487712Z","title":"Y., Dao, T., Baccus, S., Bengio, Y., Ermon, S., and Ré, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.487712Z"},"links":{"cited_paper":"/paper/2302.10866","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:371708afae1fce0f845cd8eb374731ccbc100cd6f4a41529334ac8a76d0b6ff5","observation_id":"bc1f9381-2996-4a02-ac97-a5b35ecc1a0d","resolution":{"observed_at":"2026-08-16T05:58:23.487712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17844","last_updated":"2024-08-19T17:26:18Z","snapshot_observed_at":"2026-08-17T14:38:28.563559Z","submitted_at":"2024-03-26T16:33:12Z","title":"Mechanistic Design and Scaling of Hybrid Architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17844","snapshot_observed_at":"2026-08-16T05:58:23.494761Z","title":"W., Nguyen, E., Ponnusamy, P., Deiseroth, B., Kersting, K., Suzuki, T., Hie, B., Ermon, S., Ré, C., Zhang, C., and Massaroli, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.494761Z"},"links":{"cited_paper":"/paper/2403.17844","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:ef3778db7a397f824bcae086173f13d46e3e24bf1dde0234e4cd6c5d3bb2b076","observation_id":"ffa4684d-7b11-429b-825f-1fcb7a786d67","resolution":{"observed_at":"2026-08-16T05:58:23.494761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-08-18T12:23:06.967499Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-16T05:58:23.501015Z","title":"Grokking: Generalization beyond overfitting on small algorithmic datasets, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.501015Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:23d04628dc17de6f0d314a0034bf19cf55b1dde74c5c5f761d981c5ed6fbbb9b","observation_id":"9b9b4714-0752-4657-b927-1fd22549a3fa","resolution":{"observed_at":"2026-08-16T05:58:23.501015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02217","last_updated":"2021-04-28T07:24:49Z","snapshot_observed_at":"2026-08-13T03:08:20.485293Z","submitted_at":"2020-07-16T17:52:37Z","title":"Hopfield Networks is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02217","snapshot_observed_at":"2026-08-16T05:58:23.506782Z","title":"K., Greiff, V., Kreil, D., Kopp, M., Klambauer, G., Brandstetter, J., and Hochreiter, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.506782Z"},"links":{"cited_paper":"/paper/2008.02217","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:5a54d38980055757794252c912a30d12ea9f932edcbf57649843f45c918b6650","observation_id":"2a336782-ea0f-49e6-ba49-e058633431ba","resolution":{"observed_at":"2026-08-16T05:58:23.506782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02611","last_updated":"2022-03-17T13:26:32Z","snapshot_observed_at":"2026-08-19T15:08:51.371926Z","submitted_at":"2021-02-04T13:51:19Z","title":"CKConv: Continuous Kernel Convolution For Sequential Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02611","snapshot_observed_at":"2026-08-16T05:58:23.512479Z","title":"W., Kuzina, A., Bekkers, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.512479Z"},"links":{"cited_paper":"/paper/2102.02611","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:337bff197aec16f939aff9a1e5f498efab6ddacac9a309d3ee97537a630ec6cf","observation_id":"def41f56-d776-49d4-9e1a-75cad3798479","resolution":{"observed_at":"2026-08-16T05:58:23.512479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:23.547318Z","title":"and Vetterli, M","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.547318Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:27773e03fd99e58b4964fed3970019928ffeadd09dd17e0e37b90a58f07a0cfe","observation_id":"fd95ceab-8711-48f3-8962-24d5af118457","resolution":{"observed_at":"2026-08-16T05:58:23.547318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:25.597612Z","title":null,"venue":null,"work_id":"4062d697-3d6c-4ac8-9760-775f2ccdfa20","year":1987},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.598598Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:5fff88a850b4f41b2064ed8311bf196283c70ae52bc5ffae77909124046a7e0d","observation_id":"7ee2914f-cd34-484c-9ce6-4f8c890b4bc6","resolution":{"observed_at":"2026-08-16T05:58:25.715553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-16T05:58:23.648977Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.648977Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:a822f5078ac369771de012175c2d82158f38af6d1f4a02c5be22fe450517f27a","observation_id":"612338b2-607e-4530-b778-485fce9cfea5","resolution":{"observed_at":"2026-08-16T05:58:23.648977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04271","last_updated":"2019-05-10T17:21:21Z","snapshot_observed_at":"2026-08-19T05:15:32.598405Z","submitted_at":"2019-05-10T17:21:21Z","title":"Mutual Information Scaling and Expressive Power of Sequence Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.04271","snapshot_observed_at":"2026-08-16T05:58:23.655825Z","title":"Mutual information scaling and expressive power of sequence models, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.655825Z"},"links":{"cited_paper":"/paper/1905.04271","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:446b0d140901b590ff2b3dfc72fe0353dddfbd12256eafc5ec8ca7eda4b24f9d","observation_id":"7a2383f9-cd7f-4fe5-81e8-32c8a9c2d700","resolution":{"observed_at":"2026-08-16T05:58:23.655825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-16T05:58:23.661406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.661406Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:2dae5354be62e4f5f710fd2b244796b5fcbfe775de2f7cac4aed117b5b8f1768","observation_id":"1ac35c73-3e6d-45d4-ad92-05a6c43fa1dc","resolution":{"observed_at":"2026-08-16T05:58:23.661406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-16T05:58:23.666605Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.666605Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:d87c249218a815c66a214dcc18914cc0836fbbee45a6c6563f0369fe52889b92","observation_id":"10b4f597-6b18-41f5-b30c-a52599f091cf","resolution":{"observed_at":"2026-08-16T05:58:23.666605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T05:58:23.672217Z","title":"Z., and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.672217Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:e88a4c4b6e6e90e7c3ab9f3b4d9a74ff83e23da74b986151731c5344fe64bdbc","observation_id":"eb2872e6-71dd-45b3-9642-d1d671307c1f","resolution":{"observed_at":"2026-08-16T05:58:23.672217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-16T05:58:23.677916Z","title":"Retentive network: A successor to transformer for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.677916Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:bdfd074f110525e8f8c87fc83adc8e071bd86deaff0ebc003a902b8b721ba3a5","observation_id":"916e566a-e3a5-45fc-975c-95e5c438c179","resolution":{"observed_at":"2026-08-16T05:58:23.677916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11775","last_updated":"2019-11-11T21:51:11Z","snapshot_observed_at":"2026-08-20T02:23:48.768167Z","submitted_at":"2019-08-30T15:05:02Z","title":"Transformer Dissection: A Unified Understanding of Transformer's Attention via the Lens of Kernel","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11775","snapshot_observed_at":"2026-08-16T05:58:23.696291Z","title":"H., Bai, S., Yamada, M., Morency, L.-P., and Salakhutdinov, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.696291Z"},"links":{"cited_paper":"/paper/1908.11775","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:e4d8ad5024a141fcdfe84ed0789b479d2e3326de331513dc40a602675ff16ea3","observation_id":"195ec2fb-f755-498c-a6fc-0fd18c5561f3","resolution":{"observed_at":"2026-08-16T05:58:23.696291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03915","last_updated":"2023-11-30T15:50:46Z","snapshot_observed_at":"2026-08-18T18:42:59.183235Z","submitted_at":"2023-10-05T21:44:18Z","title":"Leveraging Low-Rank and Sparse Recurrent Connectivity for Robust Closed-Loop Control","version":3},"cited_work":{"arxiv_id":"2310.03915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.03915","snapshot_observed_at":"2026-08-16T05:58:24.545915Z","title":"Leveraging Low-Rank and Sparse Recurrent Connectivity for Robust Closed-Loop Control","venue":"cs.LG","work_id":"35086056-52c3-4f86-83a6-c587532c07bc","year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.741723Z"},"links":{"cited_paper":"/paper/2310.03915","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:dd2a5327236416c4967fa94a8f5db9113e36396227c66048b17e9dcb101d88f0","observation_id":"5230f357-d0be-4f57-9183-ecbcdc9edac3","resolution":{"observed_at":"2026-08-16T05:58:24.551573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/nla.455","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:47.750906Z","title":"A note on the representation and definition of semiseparable matrices","venue":"Numerical Linear Algebra with Applications","work_id":"9165207b-2b29-4412-8a72-5038686b8116","year":2005},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.754416Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:eaafbfb58103cf01f1afe3df0ce587366ffdc7d1aff8b1836bbe657d5f066aa4","observation_id":"d7bfa6e8-c24e-4718-a1b3-c395e9039dc9","resolution":{"observed_at":"2026-08-16T05:58:24.128224Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-16T05:58:23.759783Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.759783Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:15d33e903cf6dc416bba8c94d1fa06073b75d2032d2a7f6ed6e4df9d621ee4d9","observation_id":"58be5d28-975b-4aef-b32c-de51288e90e3","resolution":{"observed_at":"2026-08-16T05:58:23.759783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05714","last_updated":"2019-06-12T15:45:26Z","snapshot_observed_at":"2026-08-14T16:16:42.947441Z","submitted_at":"2019-06-12T15:45:26Z","title":"A Multiscale Visualization of Attention in the Transformer Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05714","snapshot_observed_at":"2026-08-16T05:58:23.764858Z","title":"A multiscale visualization of attention in the transformer model, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.764858Z"},"links":{"cited_paper":"/paper/1906.05714","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:c214236c5bb2ec72470368a38858919f1e0cce8bbca6c2575da08535e7595a17","observation_id":"eeed8cd6-1070-4933-8ec9-f1d2ee30fe35","resolution":{"observed_at":"2026-08-16T05:58:23.764858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-20T16:26:42.002863Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-16T05:58:23.770327Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.770327Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:7333f2500cec0afebac405be27f826e495682d94935dc137d638848f248648a5","observation_id":"5c40f325-ab1c-43cd-b1cd-395552181fc6","resolution":{"observed_at":"2026-08-16T05:58:23.770327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-322-96657-5_5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-17T11:03:46.409680Z","title":null,"venue":"Dynamics reported","work_id":"ff427aa3-578b-4789-8a51-63fc54a01dbb","year":1989},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.775734Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:ad531558fbebca95d680d7e05c60fafff6491932e448bbeeab104e31d429f9a4","observation_id":"0a16110f-ec29-4775-8915-00f9691f6cca","resolution":{"observed_at":"2026-08-16T05:58:24.081460Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18781","last_updated":"2024-11-01T01:45:27Z","snapshot_observed_at":"2026-08-18T18:41:22.673142Z","submitted_at":"2024-05-29T05:41:28Z","title":"On the Role of Attention Masks and LayerNorm in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18781","snapshot_observed_at":"2026-08-16T05:58:23.817295Z","title":"On the role of attention masks and layernorm in transformers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.817295Z"},"links":{"cited_paper":"/paper/2405.18781","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:7c19c5b97b065ad73660636ffad9178212d2f9545e44acd1c310eeaba588e87f","observation_id":"1250d4d3-a5cf-488c-abe9-9202463c615f","resolution":{"observed_at":"2026-08-16T05:58:23.817295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/nla.691","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:47.750906Z","title":null,"venue":"Numerical Linear Algebra with Applications","work_id":"d9490073-81ad-4729-beb7-4143f0880701","year":2010},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.887092Z"},"links":{"citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:3a91a4d683e38fad4288dc4d903f61d92930214f931cb1c77df59508d494e7a1","observation_id":"a8963cd2-3dd8-42b7-b437-bbbf794c0e6c","resolution":{"observed_at":"2026-08-16T05:58:24.034342Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-20T09:03:18.402041Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-16T05:58:23.937422Z","title":"Efficient streaming language models with attention sinks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.937422Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:cbd428dbdd9824941af092514447d5d3fd1b65a1cd303c713ce2036c685afcf4","observation_id":"96c3ba13-cf54-4b5d-9691-ca18fa0fe6b7","resolution":{"observed_at":"2026-08-16T05:58:23.937422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-21T01:26:32.098232Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-16T05:58:23.950981Z","title":"Gated linear attention transformers with hardware-efficient training, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.950981Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:de316b6b86f229ea8f427fd3c2ac77aecfbb55dcd4d169d54c99eecbfe615bc3","observation_id":"8143ca89-bab3-4c22-8c0b-c0944d830e44","resolution":{"observed_at":"2026-08-16T05:58:23.950981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-16T13:44:27.642787Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-16T05:58:23.957318Z","title":"Parallelizing linear transformers with the delta rule over sequence length, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.957318Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:956f23864a2da06bd69231572f1b3995264b5dd6354e6be1ab01e9ddf297459b","observation_id":"362368b0-844d-49ac-a7cc-11f3c5848b16","resolution":{"observed_at":"2026-08-16T05:58:23.957318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06324","last_updated":"2024-07-08T18:41:01Z","snapshot_observed_at":"2026-08-18T18:41:07.764347Z","submitted_at":"2024-07-08T18:41:01Z","title":"B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06324","snapshot_observed_at":"2026-08-16T05:58:23.962479Z","title":"B'mojo: Hybrid state space realizations of foundation models with eidetic and fading memory, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.962479Z"},"links":{"cited_paper":"/paper/2407.06324","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:71e5cf702f6fe91ae8be195112d6971cb69bbf170038ba46022c0e8133e95bfd","observation_id":"7b6012e4-1cf1-4de0-a39c-cc11c3230ad2","resolution":{"observed_at":"2026-08-16T05:58:23.962479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-16T05:58:23.967907Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.967907Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:a3a8d90f950770225b4447f0da982442a637d0a44f6a76958097e05f0cc91ffb","observation_id":"67b59a98-9901-4bee-9643-75bf500aef43","resolution":{"observed_at":"2026-08-16T05:58:23.967907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":6,"verified_fuzzy":8},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 2 inbound Pith citation observations for arXiv:2504.19561."}