{"as_of":"2026-08-08T17:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00a783c77aac8b6f4218857ac1957e7fac878da0dfffda94f77c9d0c5d52bd1f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:47.613549Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T15:04:46.136709Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-07T14:44:47.613549Z","title":"Guillaume Bellec, Franz Scherr, Anand Subramoney, Elias Hajek, Darjan Salaj, Robert Legenstein, and Wolfgang Maass","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:47.613549Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:47d6fbde2b26e560569526a220aa784a5deb99ad30a2a1d19aea8dafa2cec8e4","observation_id":"ec1e4f59-413a-46e9-8bfc-2cae6704f589","resolution":{"observed_at":"2026-08-07T14:44:47.613549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-07T06:10:16.118380Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06179","last_updated":"2025-06-06T15:44:10Z","snapshot_observed_at":"2026-08-07T08:23:24.866121Z","submitted_at":"2025-06-06T15:44:10Z","title":"A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:10:16.118380Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2506.06179"},"observation_digest":"sha256:325311e9db0b90b752f9dbd48b7c7ea568b736c3abd11489676b3389d3d55002","observation_id":"2829d5ae-d210-43c7-a57f-8b0f2fb32faf","resolution":{"observed_at":"2026-08-07T06:10:16.118380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-07T00:50:29.838100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.838100Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:063fec530be8006f8daff7c13d38caeea707ef765dcee1a12e055d320255f56c","observation_id":"3c56be0f-8610-4504-8510-4e9111b6f761","resolution":{"observed_at":"2026-08-07T00:50:29.838100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-05T22:10:17.419244Z","title":", Cheng, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07571","last_updated":"2025-08-19T11:54:07Z","snapshot_observed_at":"2026-08-07T21:59:26.623348Z","submitted_at":"2025-08-11T03:05:36Z","title":"Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T22:10:17.419244Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2508.07571"},"observation_digest":"sha256:6e4a92bc839f50abe73c14831b070a0095eff2ebd02e217c953d4ada8303c478","observation_id":"1afaba9e-c5ad-414e-a3c8-348c35f33682","resolution":{"observed_at":"2026-08-05T22:10:17.419244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-04T16:23:15.929444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15543","last_updated":"2026-05-25T16:32:52Z","snapshot_observed_at":"2026-08-06T13:05:42.112772Z","submitted_at":"2025-09-19T02:51:19Z","title":"Nonconvex Decentralized Stochastic Bilevel Optimization under Heavy-Tailed Noise","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:23:15.929444Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2509.15543"},"observation_digest":"sha256:7b0275121f91b1bbaa4ba30d5d2668a6a793b3390f19803c950d6f949f37ca15","observation_id":"afa979e0-9e86-4032-993b-d27729694443","resolution":{"observed_at":"2026-08-04T16:23:15.929444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":"2310.01082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-06-30T15:04:46.136709Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization).arXiv preprint arXiv:2310.01082, 2023","venue":null,"work_id":"18377d34-502f-4926-8ead-ea0be3369ade","year":2023},"citing_paper":{"arxiv_id":"2605.11838","last_updated":"2026-05-12T09:24:59Z","snapshot_observed_at":"2026-07-06T23:23:34.924221Z","submitted_at":"2026-05-12T09:24:59Z","title":"Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:01:37.086159Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2605.11838"},"observation_digest":"sha256:2df170374fcd0c4fef3b86e5e1f53b9e6375c8f2cb269cdfd62fa52fb02d6391","observation_id":"f831fb28-cc3a-427a-a346-77d8a08ce436","resolution":{"observed_at":"2026-05-13T07:02:27.337503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":"2310.01082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-06-30T15:04:46.136709Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization).arXiv preprint arXiv:2310.01082, 2023","venue":null,"work_id":"18377d34-502f-4926-8ead-ea0be3369ade","year":2023},"citing_paper":{"arxiv_id":"2605.24513","last_updated":"2026-05-23T10:55:34Z","snapshot_observed_at":"2026-07-06T23:34:33.493637Z","submitted_at":"2026-05-23T10:55:34Z","title":"Zeroth-Order Nonconvex Nonsmooth Optimization with Heavy-Tailed Noise","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T15:04:30.204185Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2605.24513"},"observation_digest":"sha256:a0dceeb82227ca14a032ce94f51576dab4d4211bfe60c0311583ecc995e5251d","observation_id":"611116c3-b893-4fc0-b03c-8dbe8a9f2ca8","resolution":{"observed_at":"2026-06-30T15:04:46.138420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-01T08:37:46.250989Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27383","last_updated":"2026-08-02T16:57:14Z","snapshot_observed_at":"2026-08-07T23:18:07.086679Z","submitted_at":"2026-07-29T18:42:35Z","title":"The Convergence Behavior of Adam under Heavy-Tailed Noise","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T08:37:46.250989Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2607.27383"},"observation_digest":"sha256:432124f4b075a9c5ca7fb7e958e2b33d7bce887be4a21a989d955ca5985bbcfc","observation_id":"4c67f297-5b71-4076-905f-578153a0e7ea","resolution":{"observed_at":"2026-08-01T08:37:46.250989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-04T03:30:54.192015Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27383","last_updated":"2026-08-02T16:57:14Z","snapshot_observed_at":"2026-08-07T23:18:07.086679Z","submitted_at":"2026-07-29T18:42:35Z","title":"The Convergence Behavior of Adam under Heavy-Tailed Noise","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T03:30:54.192015Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2607.27383"},"observation_digest":"sha256:c269609cacafc65d4c98625363349b0bc894392e7b3ffe655975205eb9efc204","observation_id":"05b88bd0-d395-4f1b-8db1-dd7b93dd0aa7","resolution":{"observed_at":"2026-08-04T03:30:54.192015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.01082/citation-record","integrity":"/paper/2310.01082/integrity","json":"/paper/2310.01082/citation-record.json","paper":"/paper/2310.01082"},"outbound":[],"paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2310.01082."}