{"as_of":"2026-08-08T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb818bb5f7ea9854f68485ee16eba518408dfbadf7b459bba6e4633ede00091a","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:49.061779Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T15:25:21.814232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T15:26:33.682527Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"cited_work":{"arxiv_id":"2505.17852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chaubard, M","venue":null,"work_id":"a94d9f3f-8e75-4b45-ae8e-e4f84881636a","year":2025},"citing_paper":{"arxiv_id":"2509.15113","last_updated":"2026-05-04T12:39:49Z","snapshot_observed_at":"2026-07-06T22:30:11.897367Z","submitted_at":"2025-09-18T16:17:44Z","title":"Low-rank surrogate modeling and stochastic zero-order optimization for training of neural networks with black-box layers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T15:25:21.814232Z"},"links":{"cited_paper":"/paper/2505.17852","citing_paper":"/paper/2509.15113"},"observation_digest":"sha256:a7b10391071ae0f424aeba37bfeb8d89a61636af3df603e100fa90b5ee77c2fe","observation_id":"4e24ab96-e287-4206-8acc-317294dcf2a4","resolution":{"observed_at":"2026-05-18T15:26:33.685182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17852/citation-record","integrity":"/paper/2505.17852/integrity","json":"/paper/2505.17852/citation-record.json","paper":"/paper/2505.17852"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.16605","last_updated":"2024-12-02T08:41:46Z","snapshot_observed_at":"2026-07-06T18:20:09.790181Z","submitted_at":"2024-05-26T15:31:09Z","title":"Demystify Mamba in Vision: A Linear Attention Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16605","snapshot_observed_at":"2026-08-07T14:44:48.162107Z","title":"Max Jaderberg, Wojciech M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.162107Z"},"links":{"cited_paper":"/paper/2405.16605","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:7c7e649d96f298c294a20aed07956b33e40d92515008ab5153b3365a81a76ab4","observation_id":"c9085359-cf6e-40c8-9f34-c1ce24afa187","resolution":{"observed_at":"2026-08-07T14:44:48.162107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-07T14:44:48.233553Z","title":"Jack Kiefer and Jacob Wolfowitz","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.233553Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:fa8eea31e50e3acd4004666702b051cee06cae20b681de27ada7964b09375121","observation_id":"452e639c-9a53-41c3-9be9-ab3616972d59","resolution":{"observed_at":"2026-08-07T14:44:48.233553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07752","last_updated":"2025-03-13T11:14:49Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:50:37Z","title":"FlashRNN: I/O-Aware Optimization of Traditional RNNs on modern hardware","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07752","snapshot_observed_at":"2026-08-07T14:44:48.516439Z","title":"Flashrnn: Optimizing traditional rnns on modern hardware","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.516439Z"},"links":{"cited_paper":"/paper/2412.07752","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:509a0fb6d644b3706e7695a266eb9efc9942d23bd8d6bd0e8590e02e285c42cf","observation_id":"b5fb0433-8b3e-4338-bd1a-a288115f0777","resolution":{"observed_at":"2026-08-07T14:44:48.516439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.29152","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:49.568431Z","title":"Aditya Rawal and Risto Miikkulainen","venue":null,"work_id":"311e9561-ecf7-4e1c-b257-3395491a05d4","year":2019},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.591763Z"},"links":{"citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:c531f7bac96b63f9dec4e7eb98c5ca3b219e6c5b47ca31be5366f42bcf5155bd","observation_id":"c591d36a-529e-4088-ba46-6240fde96dd9","resolution":{"observed_at":"2026-08-07T14:44:49.663860Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:44:48.962796Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.962796Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:736f6d82d1968120334935d6814302f8ba4eb7c0bf74a18e781ce1adc53ec4fe","observation_id":"9cc023b2-3ebc-42ce-bb83-c01f2f4541a5","resolution":{"observed_at":"2026-08-07T14:44:48.962796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.05043","last_updated":"2017-05-23T11:42:03Z","snapshot_observed_at":"2026-07-06T05:30:17.785089Z","submitted_at":"2017-02-16T16:38:08Z","title":"Unbiased Online Recurrent Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.05043","snapshot_observed_at":"2026-08-07T14:44:48.774666Z","title":"Unbiased online recurrent optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.774666Z"},"links":{"cited_paper":"/paper/1702.05043","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:bf4a6e00d805045887cd08381ca22a18abbc8b8c0808c9f595d4dfa109d8539e","observation_id":"d0da4f7d-486b-4e53-84fc-1612d11b0d46","resolution":{"observed_at":"2026-08-07T14:44:48.774666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2005.85223","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:49.936336Z","title":"Suraj Srinivas Malladi, Xiang Wei, Josip Djolonga, and Dale Schuurmans","venue":null,"work_id":"c205089c-a71b-4d20-a71f-30654d5ceafe","year":2005},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.329435Z"},"links":{"citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:6b9477b314df209b5c539b69a7f802988579a4409f3b0dba3d969c225b0e3dff","observation_id":"d32bcea1-64c7-49e2-9041-ea2875a5bec2","resolution":{"observed_at":"2026-08-07T14:44:50.012543Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:48.689680Z","title":"doi: 10.1145/2908812.2908941","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.689680Z"},"links":{"citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:cb0ad92cb348ad5575b053a9cd9d7889b3b9c1fd7a577ec00ba3d51b4d658273","observation_id":"e5a19286-959e-4c74-8927-59b1935e1d25","resolution":{"observed_at":"2026-08-07T14:44:48.689680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-08-05T21:57:04.021766Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-08-07T14:44:48.847581Z","title":"Efficient transformers: A survey","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.847581Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:f39aabb90df63fa0cd24af08a728adbcd0876c87e32ca4c28ba2faec5b291632","observation_id":"4e49812c-ecd8-4cb3-817d-fde0fbffd9fd","resolution":{"observed_at":"2026-08-07T14:44:48.847581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T14:44:49.061779Z","title":"Susan Zhang, Stephen Roller, Naman Goyal, Mikel Artetxe, Moya Chen, Shuohui Chen, Pratik Dewan, Mona Diab, Xian Li, Xi Victoria Lin, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:49.061779Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:069d206906e8bf9f3d0ac6f6a10e5bccaf57f5e6d564a69a797866258d79c046","observation_id":"f3cf41fa-b619-4722-bf73-eaa3d9399cda","resolution":{"observed_at":"2026-08-07T14:44:49.061779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23467","last_updated":"2026-07-09T09:50:03Z","snapshot_observed_at":"2026-08-07T09:10:17.187218Z","submitted_at":"2024-10-30T21:24:34Z","title":"Koopman-informed recurrent neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23467","snapshot_observed_at":"2026-08-07T14:44:47.740119Z","title":"Erik Lien Bolager, Ana Cukarska, Iryna Burak, Zahra Monfared, and Felix Dietrich","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:47.740119Z"},"links":{"cited_paper":"/paper/2410.23467","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:b32958fe3593f3c9cd1eae8b6820b4e07e07b9ff1aa9c4eaab329834d60a7ef7","observation_id":"b04da9fd-e410-415c-8f3e-82eb4e7ac224","resolution":{"observed_at":"2026-08-07T14:44:47.740119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09823","last_updated":"2024-10-13T12:47:37Z","snapshot_observed_at":"2026-07-06T19:32:33.528354Z","submitted_at":"2024-10-13T12:47:37Z","title":"Simultaneous Computation and Memory Efficient Zeroth-Order Optimizer for Fine-Tuning Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09823","snapshot_observed_at":"2026-08-07T14:44:49.001777Z","title":"Simultaneous computation and memory efficient zeroth-order optimizer for fine-tuning large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:49.001777Z"},"links":{"cited_paper":"/paper/2410.09823","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:e200fd58dfd2295c0f505e33484aa4a1bf236dfdc59c4e552ce864c7291878fa","observation_id":"ccf275d2-8c12-401d-a93b-52688f3993e9","resolution":{"observed_at":"2026-08-07T14:44:49.001777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-07T14:44:48.421248Z","title":"Structured and sparse zeroth-order optimization for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.421248Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:1e21f7a64f7c948d1b8217a926ee2fa68d23969004bd8124cd89cd6ac5ce570b","observation_id":"8e3decb9-8c5a-4957-b82d-50682f695791","resolution":{"observed_at":"2026-08-07T14:44:48.421248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-07T14:44:47.613549Z","title":"Guillaume Bellec, Franz Scherr, Anand Subramoney, Elias Hajek, Darjan Salaj, Robert Legenstein, and Wolfgang Maass","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:47.613549Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:47d6fbde2b26e560569526a220aa784a5deb99ad30a2a1d19aea8dafa2cec8e4","observation_id":"ec1e4f59-413a-46e9-8bfc-2cae6704f589","resolution":{"observed_at":"2026-08-07T14:44:47.613549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:47.890058Z","title":"Alex Graves, Greg Wayne, and Ivo Danihelka","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:47.890058Z"},"links":{"citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:1ad210f7c37ec700a9641b4ea61e9f567c9e26176e8e15ad583ba9c79763f3a1","observation_id":"d958b103-bc00-4191-8d6c-a7e0973594d7","resolution":{"observed_at":"2026-08-07T14:44:47.890058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2505.17852."}