{"as_of":"2026-08-11T20:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4e56a7e3a813f6b7df9762cc99d223441b0c1365c622cf4cec752d838b7c902","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:50:28.835675Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00692/citation-record","integrity":"/paper/2501.00692/integrity","json":"/paper/2501.00692/citation-record.json","paper":"/paper/2501.00692"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01771","last_updated":"2024-02-01T07:15:58Z","snapshot_observed_at":"2026-08-10T21:25:11.091970Z","submitted_at":"2024-02-01T07:15:58Z","title":"BlackMamba: Mixture of Experts for State-Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01771","snapshot_observed_at":"2026-08-10T22:50:28.484069Z","title":"Blackmamba: Mixture of experts for state-space models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.484069Z"},"links":{"cited_paper":"/paper/2402.01771","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:603d9e1685f95bf94fca62c039d4a53198015497d6b1b2c422a5e150b1181d2c","observation_id":"e99b3f86-32a1-4820-8131-f8ff9c1e4fd6","resolution":{"observed_at":"2026-08-10T22:50:28.484069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00219","last_updated":"2021-04-01T03:04:40Z","snapshot_observed_at":"2026-08-11T14:37:12.375466Z","submitted_at":"2021-04-01T03:04:40Z","title":"Fast Jacobian-Vector Product for Deep Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00219","snapshot_observed_at":"2026-08-10T22:50:28.491015Z","title":"Fast jacobian-vector product for deep networks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.491015Z"},"links":{"cited_paper":"/paper/2104.00219","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:adf022414c933a4c1893323620b83b6d86c95cffbf69b51d1d2f5a84720d418b","observation_id":"bf8d5a77-5e96-4a43-ab94-2b34547d5a1f","resolution":{"observed_at":"2026-08-10T22:50:28.491015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05767","last_updated":"2018-02-05T15:57:57Z","snapshot_observed_at":"2026-07-06T04:09:45.600447Z","submitted_at":"2015-02-20T04:20:47Z","title":"Automatic differentiation in machine learning: a survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05767","snapshot_observed_at":"2026-08-10T22:50:28.502732Z","title":"Pearlmutter, Alexey Andreyevich Radul, and Jeffrey Mark Siskind","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.502732Z"},"links":{"cited_paper":"/paper/1502.05767","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:e9f23d8b80caffd75d8f0f30acb50a9d3c8a20c7bce8376b5cec856856c49fef","observation_id":"ae67fdfe-2068-4f89-b70c-69ecafbfff53","resolution":{"observed_at":"2026-08-10T22:50:28.502732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-07T15:21:45.322877Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-08-10T22:50:28.508274Z","title":"xlstm: Extended long short-term memory, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.508274Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:273a9b5e8236c1907becd20694f7bac7730b4dd705275182e22b8fa9ec46cec3","observation_id":"f895bba9-0913-44b8-9667-381d1a53c7a4","resolution":{"observed_at":"2026-08-10T22:50:28.508274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T22:50:28.514062Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.514062Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:f226168e8da645813c384e4caa1ae5251e2dcbe94270be90d3333c6dd160772c","observation_id":"85553efb-415d-49f1-b461-85f0f64bcfff","resolution":{"observed_at":"2026-08-10T22:50:28.514062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.963715Z","title":"Internlm2 technical report,","venue":null,"work_id":"6fe5a577-44a9-4dcc-a461-0c84338a0f0d","year":null},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.519633Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:372217f51b7cb58b1e864d3b9413d21233d0ff5a8815158419821dea47bbb095","observation_id":"070ce06c-5a9b-4957-a7d4-58d66004f45b","resolution":{"observed_at":"2026-08-10T22:50:29.968339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0377-0427(02)00528-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.891074Z","title":"Adjoint sensitivity analysis for differential-algebraic equations: algorithms and software","venue":null,"work_id":"20ab6d54-5ff7-4ab1-9aeb-59ab02d9774f","year":2002},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.529339Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:19247e3616c645521ab18445691496b8a2aa5228e2ebb9c097aef8be165638ca","observation_id":"0baf7150-8e83-4678-818c-fd34b341cff6","resolution":{"observed_at":"2026-08-10T22:50:28.898216Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07366","last_updated":"2019-12-14T02:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-06-19T17:50:12Z","title":"Neural Ordinary Differential Equations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07366","snapshot_observed_at":"2026-08-10T22:50:28.535476Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.535476Z"},"links":{"cited_paper":"/paper/1806.07366","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:99132bab7364f08636a1aa107a34b841b67a181bdec0f5cbe972366a229d55bc","observation_id":"aecbb979-4b57-4028-99f2-0f5bb7231634","resolution":{"observed_at":"2026-08-10T22:50:28.535476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-10T22:50:28.540632Z","title":"Extending context window of large language models via positional interpolation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.540632Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:4e92c67e3b4b4711cefa6c5fed065780f0c43f70d9d28a49e5e870c9efca58dc","observation_id":"edbbc815-26f6-4d04-a078-fd8f06a5d57f","resolution":{"observed_at":"2026-08-10T22:50:28.540632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-10T18:05:01.074940Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-10T22:50:28.546514Z","title":"Longlora: Efficient fine-tuning of long-context large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.546514Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:3c3e7af201a176d85f280d0c3b5c8b3cbd652963fdce69e77d773ff8116c498b","observation_id":"624eaeba-c5b0-4f3a-8862-1ecbeae640df","resolution":{"observed_at":"2026-08-10T22:50:28.546514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09977","last_updated":"2023-05-31T23:37:17Z","snapshot_observed_at":"2026-08-02T16:53:44.461862Z","submitted_at":"2023-01-22T08:45:30Z","title":"The Backpropagation algorithm for a math student","version":3},"cited_work":{"arxiv_id":"2301.09977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.09977","snapshot_observed_at":"2026-08-10T22:50:29.542665Z","title":"The Backpropagation algorithm for a math student","venue":"cs.LG","work_id":"dd939511-2df1-44f4-849d-66267b670dd2","year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.551587Z"},"links":{"cited_paper":"/paper/2301.09977","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:c4d3665463d2f3893de4dc2e10bfe60ade5d2b3d9a6613b1017a9011d12876a1","observation_id":"c5668d3e-01c5-47dd-b180-8403a30e76b6","resolution":{"observed_at":"2026-08-10T22:50:29.547231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-10T22:50:28.557753Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.557753Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:efdf2ebbb82afe86f7c58dbf58bd4f70740a6951bfc2c0eb473af97c7a7ce990","observation_id":"ef15a127-c9d4-4244-b772-366c06a7db7d","resolution":{"observed_at":"2026-08-10T22:50:28.557753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-10T22:50:28.568578Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.568578Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:4d333bde8a040ca561cae23b5060aff4690d3db6a4241d7174c8d8d3039cbf5c","observation_id":"1094675c-c2f8-4d8b-a53c-f348e20cbd90","resolution":{"observed_at":"2026-08-10T22:50:28.568578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-10T22:50:28.573058Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.573058Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:869cbc5341b9981f4fb2a10829e7dfc3cccc44c1aa46f2e26c7c49c1d41bae9c","observation_id":"8a49de87-00d2-443a-b115-f71f4beb563f","resolution":{"observed_at":"2026-08-10T22:50:28.573058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.948144Z","title":null,"venue":null,"work_id":"1245381f-2ea5-455a-b198-851c279fcdc7","year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.579575Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:5c7c44a982b8797947a514f29f4d66de8192fdfbff1b9b73652edda4dea12df5","observation_id":"c36509f4-1270-44cc-af80-1555ab80fb33","resolution":{"observed_at":"2026-08-10T22:50:29.953519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-10T22:50:28.589583Z","title":"Longrope: Extending llm context window beyond 2 million tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.589583Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:6273ead86a414245597a94462ccc6a4c3ed39ffa33a7164c2826a86ea59e88a2","observation_id":"4277793a-c7d5-4b8b-a87b-e385df3b5f10","resolution":{"observed_at":"2026-08-10T22:50:28.589583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01681","last_updated":"2019-10-26T15:37:14Z","snapshot_observed_at":"2026-08-11T12:28:06.502305Z","submitted_at":"2019-04-02T21:50:34Z","title":"Augmented Neural ODEs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01681","snapshot_observed_at":"2026-08-10T22:50:28.593837Z","title":"Augmented neural odes, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.593837Z"},"links":{"cited_paper":"/paper/1904.01681","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:651f93d846c58ae28059194b05613bed652e1107222abf4d8708a81cd37ab125","observation_id":"4ef388c6-e212-4c3e-961a-2c65891d49d6","resolution":{"observed_at":"2026-08-10T22:50:28.593837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.931939Z","title":"Fu, Tri Dao, Khaled K","venue":null,"work_id":"2817c414-ae82-471e-9a06-18ee74d259e5","year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.598096Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:791b6f7341f451f24590a613227a1b3db7b673e0770430a7d2828fd8be6965b9","observation_id":"6b230c12-468d-4b42-a2f2-a1733d9d5ff2","resolution":{"observed_at":"2026-08-10T22:50:29.937435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-10T22:50:28.606419Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.606419Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:701e5219b68846e6a236babb43bd1c17ab5931944675cd586a5b8419574a0a4c","observation_id":"42dda1f6-ddd6-4dd3-83db-7ee9bf0e7251","resolution":{"observed_at":"2026-08-10T22:50:28.606419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13985","last_updated":"2021-10-26T19:44:53Z","snapshot_observed_at":"2026-08-11T05:11:36.583031Z","submitted_at":"2021-10-26T19:44:53Z","title":"Combining Recurrent, Convolutional, and Continuous-time Models with Linear State-Space Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13985","snapshot_observed_at":"2026-08-10T22:50:28.610398Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state-space layers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.610398Z"},"links":{"cited_paper":"/paper/2110.13985","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:3d3ffc054f0d546c2a53f396785bdb6142c0e60efcffb44c48a85d82b42dfc0b","observation_id":"283b746e-b320-4c1b-bf46-a6f3ebf6f618","resolution":{"observed_at":"2026-08-10T22:50:28.610398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12037","last_updated":"2022-08-05T17:35:04Z","snapshot_observed_at":"2026-08-11T17:57:26.682763Z","submitted_at":"2022-06-24T02:24:41Z","title":"How to Train Your HiPPO: State Space Models with Generalized Orthogonal Basis Projections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.12037","snapshot_observed_at":"2026-08-10T22:50:28.614831Z","title":"How to train your hippo: State space models with generalized orthogonal basis projections, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.614831Z"},"links":{"cited_paper":"/paper/2206.12037","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:1d095fcedc10ae185f67115891e6428506427513250b7d3c7ef71d6ae4d2340b","observation_id":"dd6a2829-5bc1-4f5a-897c-8eee0cf5a9c5","resolution":{"observed_at":"2026-08-10T22:50:28.614831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.917047Z","title":"Attention mechanisms in computer vision: A survey","venue":null,"work_id":"330ceda4-9785-4619-87fd-606da84f3984","year":2022},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.619200Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:aea1b00c45d24160d5732f881040dd2d3a37c71beeb232a85d6320f19d434a40","observation_id":"43a4e018-a215-4ca5-a18a-c0572863726e","resolution":{"observed_at":"2026-08-10T22:50:29.921783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00768","last_updated":"2023-11-14T16:52:48Z","snapshot_observed_at":"2026-08-06T08:24:06.668108Z","submitted_at":"2022-12-01T18:53:06Z","title":"Simplifying and Understanding State Space Models with Diagonal Linear RNNs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00768","snapshot_observed_at":"2026-08-10T22:50:28.623895Z","title":"Simplifying and understanding state space models with diago- nal linear rnns, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.623895Z"},"links":{"cited_paper":"/paper/2212.00768","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:dd8b124372cb53e32b8c543eb9cfaaaa54cb63896d9dabe3b917a06868219ad4","observation_id":"22e3801c-b225-49bc-8bc2-f8d06774a95d","resolution":{"observed_at":"2026-08-10T22:50:28.623895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-10T22:50:28.629714Z","title":"Deep residual learning for image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.629714Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:2d5d092227bac48c463fe586c427147aec19558828f79477c7878cfa4a4da1ba","observation_id":"2bfc6337-d651-443b-aba5-7c2030a42c8b","resolution":{"observed_at":"2026-08-10T22:50:28.629714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.634649Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.634649Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:40b213b0d5a5e485abd48ec84dd598233d755f894d2a74950d6dccd20dd15764","observation_id":"1d7e40de-c191-407a-bcb0-97e1b28d4108","resolution":{"observed_at":"2026-08-10T22:50:28.634649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.639358Z","title":"Optimal checkpointing for heterogeneous chains: how to train deep neural networks with limited memory, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.639358Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:dd712ee87e6b4627fd78553d6a78037d6cc90b107080270bf83e72631a750d3e","observation_id":"4e9c8b16-e551-43a8-8a21-be6f31b3a379","resolution":{"observed_at":"2026-08-10T22:50:28.639358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.892177Z","title":"A tutorial on training recurrent neural networks , covering bppt , rtrl , ekf and the ” echo state network ” approach - semantic scholar","venue":null,"work_id":"fb83ab2f-5868-4908-b7ac-9ba3f2557bbc","year":2002},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.644010Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:f67faa550fd9b3a054cf38e8507e2bc8be774a8aa4336ce7d61a6f637ddefb43","observation_id":"6cf268e0-d752-4456-8bdd-b6f75035f474","resolution":{"observed_at":"2026-08-10T22:50:29.896896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.876015Z","title":"Adjoint methods and sensitivity analysis for recurrence, 01 2007","venue":null,"work_id":"5eb62575-d4e6-43de-a979-d4cc0ccc03b6","year":2007},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.648655Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:701bc82bb31bf48eacdd1e991d94f349321c7ad3fe831cb08a30e414f6c52903","observation_id":"1ab5ffaa-01d8-464f-bbe5-57e8008714ae","resolution":{"observed_at":"2026-08-10T22:50:29.880912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.860582Z","title":"Linear dynamical systems as a core computational primitive","venue":null,"work_id":"8a6aa429-b156-4bcc-96be-fbcde84569a3","year":2020},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.653859Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:42f359d2ee3a13404dc256dfd017eb7c87fe266a8942251c893c1c1cee38df75","observation_id":"5bcfbff1-cf11-448a-81fb-c1315c223a02","resolution":{"observed_at":"2026-08-10T22:50:29.865266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.658687Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.658687Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:b4180a2d8406003eec55feb607939b41d37d98cf4c2f052856f4379dc653ff2d","observation_id":"55b31091-3be3-4176-ad29-9abff81abd8c","resolution":{"observed_at":"2026-08-10T22:50:28.658687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.833816Z","title":"Gonzalez, Ion Stoica, Xuezhe Ma, and Hao Zhang","venue":null,"work_id":"60601d90-cf57-45b4-86f8-a5dab1c943de","year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.663400Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:73b7310e1475121ad35ee515a0ff985a96881708170c0f25b0c702b37aaab6ac","observation_id":"b45875e8-6c89-4120-814a-ba7e78919f9e","resolution":{"observed_at":"2026-08-10T22:50:29.838923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-08-10T19:55:45.249416Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-10T22:50:28.668601Z","title":"Long-context llms struggle with long in-context learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.668601Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:7bb81e185f3aad2b06d0cbe1edf0a74654067960e8b422b70be3f0a6b5a94daa","observation_id":"94d34a26-4942-442e-8c0f-5424ce90dda9","resolution":{"observed_at":"2026-08-10T22:50:28.668601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-10T22:50:28.673258Z","title":"Jamba: A hybrid transformer-mamba language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.673258Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:f360f25963cf20fd032a0ca316f4e53d41ca020818f085731a17ebdf80022f82","observation_id":"e761159d-6db4-4d7b-8acb-01dfb22f5555","resolution":{"observed_at":"2026-08-10T22:50:28.673258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.817147Z","title":"Ring attention with blockwise transformers for near-infinite context,","venue":null,"work_id":"4591bbed-a637-46f5-ae3a-6e46b56e0a23","year":null},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.678219Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:baa957d83260bcad67b4ae11a1a183bb12923d8a4113209344804550397e6b99","observation_id":"d8cefb4f-686a-4888-9fbc-bd8788478359","resolution":{"observed_at":"2026-08-10T22:50:29.822170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-10T22:50:28.688390Z","title":"World model on million-length video and language with blockwise ringattention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.688390Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:942f6e8e4eae157a901127ca5c6ef4259b855ef78880810348202a0d4e326142","observation_id":"3d1ec21e-95f6-47a5-9577-58695bad7677","resolution":{"observed_at":"2026-08-10T22:50:28.688390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:50:28.693596Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.693596Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:7cf08b6dfe351ed7e7c028fd9c1fbf6907086da55538baa184bc135dba5b99c1","observation_id":"009032f5-bff7-4f07-85d2-7600c62db912","resolution":{"observed_at":"2026-08-10T22:50:28.693596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-10T22:50:28.698249Z","title":"Mixed precision training, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.698249Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:d5857501f7d88c64845775f7c206ed71758c28bc5ed6919ca39dbada297230a5","observation_id":"c83296ba-ed55-46b3-9b3f-d7be246c9d41","resolution":{"observed_at":"2026-08-10T22:50:28.698249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08720","last_updated":"2022-06-17T12:18:22Z","snapshot_observed_at":"2026-08-06T02:16:15.811627Z","submitted_at":"2022-06-17T12:18:22Z","title":"Fast Finite Width Neural Tangent Kernel","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08720","snapshot_observed_at":"2026-08-10T22:50:28.703665Z","title":"Schoenholz","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.703665Z"},"links":{"cited_paper":"/paper/2206.08720","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:864eb057533abae2a48069d85e6838478a8718f5390b0efd3a4e35b020fd0a4f","observation_id":"0f8e9868-8353-4e7d-9dd9-99b5e5303970","resolution":{"observed_at":"2026-08-10T22:50:28.703665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.801417Z","title":"Matrix multiplication background user’s guide, 2024","venue":null,"work_id":"ac70c3a6-0f3c-4eea-95a6-1e8d947b350f","year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.708445Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:ac7f4ac74e9922a0b504be7c4f71523594c78387ba31bdf8f8bca140215256bb","observation_id":"c8b882df-8c3f-48d7-a072-4ebc5c82c2db","resolution":{"observed_at":"2026-08-10T22:50:29.806652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:50:28.713364Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.713364Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:b365360fde31c8f11a6e3f5de8316765b86a177770b415eb118374ee365e4961","observation_id":"a9f0488d-6a2a-473b-854b-f8504d364620","resolution":{"observed_at":"2026-08-10T22:50:28.713364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.785183Z","title":"Resurrecting recurrent neural networks for long sequences, 2023","venue":null,"work_id":"6de0199d-29c4-43bd-9d8f-61f820bbdbaf","year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.717938Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:91f9afa0705039c1be1da70d5bd4ebbd88617093f079e8678faaadf12c612c0c","observation_id":"6bb42725-7c29-4c50-85c3-f8604c0edca3","resolution":{"observed_at":"2026-08-10T22:50:29.790576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.769161Z","title":"On the difficulty of training recurrent neural networks,","venue":null,"work_id":"b4e3f6df-15a1-47f0-a227-e23deec89114","year":null},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.722494Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:5678f31a17f2dddcd3c415bd5f41765ac5b63b3370a8d80dc82f0a71792194a1","observation_id":"231e8049-bb44-49ad-a252-7d3d0182f369","resolution":{"observed_at":"2026-08-10T22:50:29.774729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-10T22:50:28.733647Z","title":"Pytorch: An imperative style, high-performance deep learning library, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.733647Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:068b6f9439472aaead8c10fe7720afc54b3d679b8514ffc070ca21ef4851488c","observation_id":"7d849226-e6e1-4061-81f0-efbe283bd521","resolution":{"observed_at":"2026-08-10T22:50:28.733647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.738118Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.738118Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:f3ee5833c1f02fbb449547b39dc10bba15ed9087522ecf4adbfa2a5c3e365b6a","observation_id":"b15134ab-d40e-45b2-ae64-92ec8b38bb1d","resolution":{"observed_at":"2026-08-10T22:50:28.738118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-10T22:50:28.742462Z","title":"Wind, Stanislaw Wozniak, Ruichong Zhang, Zhenyuan Zhang, Qihang Zhao, Peng Zhou, Qinghua Zhou, Jian Zhu, and Rui-Jie Zhu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.742462Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:2185b4012ca0d89ac86ffe487747cd217fa45cc07f6d5f493cd655365cd7f23a","observation_id":"c1e48a4e-0276-419f-a9fe-05bf2653e47c","resolution":{"observed_at":"2026-08-10T22:50:28.742462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-10T22:50:28.746548Z","title":"Yarn: Efficient context window extension of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.746548Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:e150ca451286b99c54e63e40b901d7c3727b81143bf87438b83542a36ca04fb5","observation_id":"cbeac19b-314b-42a3-9dcf-3144c5f2fe51","resolution":{"observed_at":"2026-08-10T22:50:28.746548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04081","last_updated":"2024-02-26T17:04:41Z","snapshot_observed_at":"2026-08-09T10:57:15.553549Z","submitted_at":"2024-01-08T18:35:07Z","title":"MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04081","snapshot_observed_at":"2026-08-10T22:50:28.750951Z","title":"Moe-mamba: Efficient selective state space models with mixture of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.750951Z"},"links":{"cited_paper":"/paper/2401.04081","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:c0694c2b8e8f84bbe806d82887b805fc6c94f14f2b2f0caa3a23aaa278dae214","observation_id":"f511de94-55b9-4601-b157-f583ccb982dc","resolution":{"observed_at":"2026-08-10T22:50:28.750951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-10T22:50:28.760927Z","title":"Zero: Memory optimizations toward training trillion parameter models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.760927Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:4ade69836f2010042b3e96654e3d1409ec348bfd25ef2b411395fd386c999480","observation_id":"45c9323e-e783-49d2-89b4-90629e0a17f6","resolution":{"observed_at":"2026-08-10T22:50:28.760927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-07-06T10:33:17.427927Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-10T22:50:28.765359Z","title":"Zero-offload: Democratizing billion-scale model training, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.765359Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:b27f37927ab2fb5c6912faafcd6be89d9a662e1914db2455f32c4269961563f7","observation_id":"87cd75ca-9024-4b70-9036-d4edcb65e7c0","resolution":{"observed_at":"2026-08-10T22:50:28.765359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.744528Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision, 2024","venue":null,"work_id":"427769d8-a15d-4761-b62b-e38b83f806b9","year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.770760Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:5d4c685aff3fc6547df24ae2b729d60d851797bd8fc4e5dc0ae87f47b8e329ff","observation_id":"a6a2acd4-bcb0-4569-8169-b00b439bd6fd","resolution":{"observed_at":"2026-08-10T22:50:29.749372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10631","last_updated":"2022-04-08T23:46:51Z","snapshot_observed_at":"2026-08-01T19:45:27.992571Z","submitted_at":"2019-04-24T03:44:58Z","title":"Low-Memory Neural Network Training: A Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10631","snapshot_observed_at":"2026-08-10T22:50:28.775364Z","title":"Sohoni, Christopher R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.775364Z"},"links":{"cited_paper":"/paper/1904.10631","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:e070880e7a6d1fff6443301d144d3fec17d5a4b6c6bf0c4f05aa17a3825e4801","observation_id":"c968568b-da2d-4c22-8a6d-6eb31d3dd92b","resolution":{"observed_at":"2026-08-10T22:50:28.775364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08209","last_updated":"2017-05-23T12:32:48Z","snapshot_observed_at":"2026-07-06T05:43:52.691426Z","submitted_at":"2017-05-23T12:32:48Z","title":"Unbiasing Truncated Backpropagation Through Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08209","snapshot_observed_at":"2026-08-10T22:50:28.780156Z","title":"Unbiasing truncated backpropagation through time, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.780156Z"},"links":{"cited_paper":"/paper/1705.08209","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:0e9e197b34f6f070313bdafb396831ab41d5adc48f825e66f2f1591058dc6232","observation_id":"6c7a2c8c-4fcf-473d-84be-56c2712d83d7","resolution":{"observed_at":"2026-08-10T22:50:28.780156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.729325Z","title":"Focused transformer: Contrastive training for context scaling, 2023","venue":null,"work_id":"55745f3b-857a-4c0c-8fbe-d313867f4306","year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.785242Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:10e02721d32917181e87137146a74ca198d1685d480a87afea632cd7c5d22259","observation_id":"f2eb26b8-3649-473e-97e5-0ab9ec96c32f","resolution":{"observed_at":"2026-08-10T22:50:29.733806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.714817Z","title":"Ntk-aware scaled rope, 2023","venue":null,"work_id":"221385a7-434b-4a05-b1af-7c8960e1d1e5","year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.790111Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:823d7071b4346f2a60671c3f99c91dcd457c66c811b43935826e00167117fda8","observation_id":"522d017f-3044-4443-8c6c-126d5db9fe90","resolution":{"observed_at":"2026-08-10T22:50:29.719374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T22:50:28.794937Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.794937Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:99360a41ea2950ef14ca5ba962afacb365135242064a5501f4adf1f553da438c","observation_id":"b8ba6447-40e7-4c8f-8362-e8d8c5f2d1d7","resolution":{"observed_at":"2026-08-10T22:50:28.794937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.799594Z","title":"Rellermeyer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.799594Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:d88df6762fb5fb98f863baa87b462f38afea38cf91b4ead566569b9ef677bb1f","observation_id":"18190afd-0c24-4dfd-b0e1-9a504fd379e8","resolution":{"observed_at":"2026-08-10T22:50:28.799594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-10T22:50:28.804313Z","title":"An empirical study of mamba-based language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.804313Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:247be3f4022cd254263148c92d456eec005b7bd0af8f41b97c447fdfacd2684c","observation_id":"ba32e0c4-e6db-46c1-9f36-5966078f0baf","resolution":{"observed_at":"2026-08-10T22:50:28.804313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13414","last_updated":"2023-11-01T11:35:26Z","snapshot_observed_at":"2026-07-06T16:22:46.711142Z","submitted_at":"2023-09-23T15:55:12Z","title":"State-space Models with Layer-wise Nonlinearity are Universal Approximators with Exponential Decaying Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13414","snapshot_observed_at":"2026-08-10T22:50:28.809266Z","title":"State-space models with layer-wise nonlinearity are universal approximators with exponential decaying memory, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.809266Z"},"links":{"cited_paper":"/paper/2309.13414","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:dc5bfc10407c8cd5efb7ce55542e939c7fbdb252f5bc9393a1a347d5f12e47b5","observation_id":"f0b74476-409f-4245-98ff-b089b3a59bd1","resolution":{"observed_at":"2026-08-10T22:50:28.809266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:28.814054Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.814054Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:d750274054e0dc09a38acaeac55f200c9c5bdd7402f9fe28d0337a174df448c6","observation_id":"cf45a7c3-f255-4093-b336-27e0016e5151","resolution":{"observed_at":"2026-08-10T22:50:28.814054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-10T22:50:28.818518Z","title":"Efficient streaming language models with attention sinks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.818518Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:9ce09cff05bb9c88c5142c2d8b6d502d658ef00e42d952981abe0660f65e7ad0","observation_id":"bc78160b-148b-433f-b4a6-75ee14b43cba","resolution":{"observed_at":"2026-08-10T22:50:28.818518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13207","last_updated":"2022-11-09T05:21:09Z","snapshot_observed_at":"2026-08-02T11:46:02.574375Z","submitted_at":"2021-11-25T18:25:09Z","title":"Characteristic Neural Ordinary Differential Equations","version":4},"cited_work":{"arxiv_id":"2111.13207","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.13207","snapshot_observed_at":"2026-08-10T22:50:28.945853Z","title":"Characteristic Neural Ordinary Differential Equations","venue":"cs.LG","work_id":"0380ec26-a30f-4521-9918-4ce155624027","year":2021},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.822823Z"},"links":{"cited_paper":"/paper/2111.13207","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:7709577d84f354906ff6f18be6ee32e9bb87cf986229e4039df31308d5b82b09","observation_id":"b91f716d-7110-4e49-8df6-3f18f13b72f3","resolution":{"observed_at":"2026-08-10T22:50:28.951016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:29.698566Z","title":"Focal self- attention for local-global interactions in vision transformers, 2021","venue":null,"work_id":"6352c6c2-7af9-4b27-9c88-930c77e264c1","year":2021},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.827158Z"},"links":{"citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:4faf927cfd0dfa38b3cd3ffac6c4f0afd31a25c7bcdc60ca51eff2dd3e954e40","observation_id":"b399dfae-e754-4ec6-9c80-17ff7042c01a","resolution":{"observed_at":"2026-08-10T22:50:29.703945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03462","last_updated":"2024-10-11T02:18:24Z","snapshot_observed_at":"2026-08-05T14:53:23.650244Z","submitted_at":"2024-01-07T11:57:40Z","title":"Long Context Compression with Activation Beacon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03462","snapshot_observed_at":"2026-08-10T22:50:28.831365Z","title":"Soaring from 4k to 400k: Extending llm’s context with activation beacon, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.831365Z"},"links":{"cited_paper":"/paper/2401.03462","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:3770dc5a1f4f7ca4453e8b4beaa5b9292cff36d723c51bd0a06d2ecddca8541f","observation_id":"422cebae-62f4-4436-84fe-5189484914e8","resolution":{"observed_at":"2026-08-10T22:50:28.831365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T22:50:28.835675Z","title":"tX i=1 dlt dyt λt,i(Ai θhi−1 + Bi θ ˆxi) # + dlt dyt Ct θht =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.835675Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:004ee701912d05c1edacea7debfbca2f0a6af729a859d0f2040edd64a83cba2a","observation_id":"b940b398-90de-4f1e-8780-c9364d5ff600","resolution":{"observed_at":"2026-08-10T22:50:28.835675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.5063","last_updated":"2013-02-16T00:35:48Z","snapshot_observed_at":"2026-08-07T12:06:37.739332Z","submitted_at":"2012-11-21T15:40:11Z","title":"On the difficulty of training Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.5063","snapshot_observed_at":"2026-08-10T22:50:28.727533Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.727533Z"},"links":{"cited_paper":"/paper/1211.5063","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:6f75459daf76809c714254160581ff8de20266e4f80c96889c34c95e25ce1939","observation_id":"51b3fa41-2ff7-4646-b78c-2eb3f411c157","resolution":{"observed_at":"2026-08-10T22:50:28.727533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-10T22:50:28.683339Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.683339Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:278e36e93e1c93831d58e197b38de12c00caa2a147a06107ef7b2592894dff98","observation_id":"6517988b-e2bb-4e52-9ceb-6487f6dc82f1","resolution":{"observed_at":"2026-08-10T22:50:28.683339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-10T22:50:28.524381Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.524381Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:6530bd21cb451b6e06ee714242e87d62b1786fea59bb06303469f3c303bc4442","observation_id":"29b6cc77-4fc1-4b37-974e-fff6fe7095ba","resolution":{"observed_at":"2026-08-10T22:50:28.524381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T14:36:39.612089Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2501.00692."}