{"as_of":"2026-08-11T07:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68a84466f54307156201d558d49032d601fe7706e6331e9a84a3b3e0afb8402f","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:12:09.330745Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15570/citation-record","integrity":"/paper/2501.15570/integrity","json":"/paper/2501.15570/citation-record.json","paper":"/paper/2501.15570"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.10189","last_updated":"2025-02-08T20:53:16Z","snapshot_observed_at":"2026-08-10T23:31:58.808360Z","submitted_at":"2024-08-19T17:48:11Z","title":"Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10189","snapshot_observed_at":"2026-08-10T14:12:09.274935Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.274935Z"},"links":{"cited_paper":"/paper/2408.10189","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:cb7ebb8a329e1723ea0fb4bf510868db3909beb9c9661675c279c2df26b8e7d2","observation_id":"fd45bb74-2fdf-41ca-9b0c-e68ed34e2115","resolution":{"observed_at":"2026-08-10T14:12:09.274935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-02T12:55:25.835610Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-10T14:12:09.285754Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.285754Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:1abaff5f334f7b71959f4041324c461771f63e96643330bcb30268012af42fff","observation_id":"3cf72c39-56e3-4580-92ce-4b5fb40f27dd","resolution":{"observed_at":"2026-08-10T14:12:09.285754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12537","last_updated":"2025-03-18T13:13:18Z","snapshot_observed_at":"2026-07-06T19:52:37.903769Z","submitted_at":"2024-11-19T14:35:38Z","title":"Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12537","snapshot_observed_at":"2026-08-10T14:12:09.290924Z","title":"Grazzi, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.290924Z"},"links":{"cited_paper":"/paper/2411.12537","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:1c90c7a163d6a1121e7c3afd5e52993cd8cd261e0df93b8841dfbda27839f1d5","observation_id":"18d5dccf-1765-4ed5-81de-87a540fed9b1","resolution":{"observed_at":"2026-08-10T14:12:09.290924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T14:12:09.295989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.295989Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:02ef8679e225e02da02acab4ca85648a0d161a2ddd245c475167393f13c413bd","observation_id":"78e15a5c-d049-4bb8-9e1a-f3d13f650b40","resolution":{"observed_at":"2026-08-10T14:12:09.295989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-10T10:37:29.996750Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-10T14:12:09.305901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.305901Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:a87f5e7bb96cbf3975a2300c626407f1fcdf22765fa54ac2a7c63f6e02a95f1c","observation_id":"24283ca9-3110-4d8f-8cd4-f7c4a5bee0f7","resolution":{"observed_at":"2026-08-10T14:12:09.305901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09563","last_updated":"2024-12-12T18:48:51Z","snapshot_observed_at":"2026-08-06T04:46:00.354780Z","submitted_at":"2024-12-12T18:48:51Z","title":"Does Representation Matter? Exploring Intermediate Layers in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09563","snapshot_observed_at":"2026-08-10T14:12:09.311351Z","title":"Skean, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.311351Z"},"links":{"cited_paper":"/paper/2412.09563","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:bf2f7b964506e17331d6eb2373649a8af39bcb2fd81d201b1bea779adf89afe5","observation_id":"f7266d44-4367-4cd9-a15a-43d57ceda7f9","resolution":{"observed_at":"2026-08-10T14:12:09.311351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-08-06T20:29:20.982892Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-08-10T14:12:09.316087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.316087Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:2ef1dd3d33a4e40117a501b76a75e8c09eedd65148d0d8a8ae5bb60f6f0ffcaf","observation_id":"e9e7356a-b58e-43ec-9070-b21da643d96d","resolution":{"observed_at":"2026-08-10T14:12:09.316087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-10T14:12:09.321052Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.321052Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:dc5ba53041384acf6c8f9b977804f4932cc586dd19ce19ad60a8c2b4692eb4cf","observation_id":"dfdf35f7-d924-4c10-923a-abf2a84ecc06","resolution":{"observed_at":"2026-08-10T14:12:09.321052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:12:09.518538Z","title":null,"venue":null,"work_id":"e365d276-a6ce-4f09-9853-521289ff4c30","year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.330745Z"},"links":{"citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:be9a5a1eea03ff949f42b88376e0588ae88e903701cc983ad384ac5504c2c018","observation_id":"1b88f967-2e68-46ea-b850-3de81b0e9cfd","resolution":{"observed_at":"2026-08-10T14:12:09.524148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08819","last_updated":"2025-03-05T23:00:57Z","snapshot_observed_at":"2026-07-06T17:59:38.202928Z","submitted_at":"2024-04-12T21:30:06Z","title":"The Illusion of State in State-Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08819","snapshot_observed_at":"2026-08-10T14:12:09.300831Z","title":"Merrill, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.300831Z"},"links":{"cited_paper":"/paper/2404.08819","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:ce91b309e647dda63cd5dbbbb5c5aeb733306a503a743726adbe09046c78c595","observation_id":"7d0bac67-8be8-45dc-b788-465f0ac245b9","resolution":{"observed_at":"2026-08-10T14:12:09.300831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-10T14:12:09.325861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.325861Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:75bada1305a484a04473a002b6d203d38559a8cb32d9792d94616a01e9797caf","observation_id":"fe699a78-8f89-4648-b91c-69a777607587","resolution":{"observed_at":"2026-08-10T14:12:09.325861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:12:09.534618Z","title":"Castin, P","venue":null,"work_id":"e806c7ea-bcc2-45b5-b633-9994bde3d0c7","year":2024},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.280969Z"},"links":{"citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:471bc5ed55bf7f5e1b9857a6642267f2df5eb54755fff226b1cf771249273a13","observation_id":"78a674c9-4d27-41dd-8a16-d7a1c867bfe3","resolution":{"observed_at":"2026-08-10T14:12:09.539210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T14:07:38.190121Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2501.15570."}