{"as_of":"2026-08-08T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc023b672f0e548a2117ba85d92b09b5f4d653bceed703ce93c97b1ada13ae6b","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:17:37.970701Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T21:05:45.024226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T21:09:02.660665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"cited_work":{"arxiv_id":"2506.03077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03077","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gongrui Nan, Siye Chen, Jing Huang, Mengyu Lu, Dexun Wang, Chunmei Xie, Weiqi Xiong, Xianzhou Zeng, Qixuan Zhou, Yadong Li, and Xingzhong Xu","venue":null,"work_id":"01151912-94bb-4390-b001-4ab10a453a56","year":null},"citing_paper":{"arxiv_id":"2605.16154","last_updated":"2026-05-15T16:33:59Z","snapshot_observed_at":"2026-07-06T23:27:20.429737Z","submitted_at":"2026-05-15T16:33:59Z","title":"Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T21:05:45.024226Z"},"links":{"cited_paper":"/paper/2506.03077","citing_paper":"/paper/2605.16154"},"observation_digest":"sha256:1aded7bb0def8ba5bad79da43ea410abfca1637a9cfd4b895a41044adcfd4894","observation_id":"5ff6b850-2079-4cb7-9d0e-ae335982c396","resolution":{"observed_at":"2026-05-20T21:09:02.662223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03077/citation-record","integrity":"/paper/2506.03077/integrity","json":"/paper/2506.03077/citation-record.json","paper":"/paper/2506.03077"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:17:35.347052Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.347052Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:fb9dfecd63f5122d9389326cb6b2b7cd8c86a02da9b056f510451dbc2030b5d3","observation_id":"ce1ef4b6-dc6c-438a-9191-552448c946c7","resolution":{"observed_at":"2026-08-07T11:17:35.347052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:35.397085Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.397085Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:e9e40b49cd14bbbb4236f1eff128a9ede63b3253e4a634f689c01abd3ef104cd","observation_id":"8a1bc54c-b3c1-4dc2-b9be-0a48a35291f0","resolution":{"observed_at":"2026-08-07T11:17:35.397085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T11:17:35.485503Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4.arXiv preprint arXiv:2303.12712, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.485503Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:e188d04011bbbcca25ebfaa888951542d5f7a503ad6c2c428efbb177be8f77d7","observation_id":"d6ac6422-7653-49a6-94ea-aa044d1ae0a8","resolution":{"observed_at":"2026-08-07T11:17:35.485503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-07T11:17:35.549383Z","title":"Training deep nets with sublinear memory cost.arXiv preprint arXiv:1604.06174, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.549383Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:f0a2d86690da67bd36bc55c517ac855f8b60e7c4b13ba4c44b13311841894e3a","observation_id":"10f603e4-e3fe-44d3-a401-4caa62d4191a","resolution":{"observed_at":"2026-08-07T11:17:35.549383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:39.296886Z","title":"QLoRA: Efficient finetuning of quantized LLMs.Advances in Neural Information Processing Systems, 36, 2023","venue":null,"work_id":"70adf4a6-6700-486b-8769-58dd4f5736e2","year":2023},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.603553Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:6bb2f1da2a0d521de71608a3c806cf9b61257717457b27a4104fbc427a485255","observation_id":"50e68872-b351-4f6b-a2ea-b6cbac7916b9","resolution":{"observed_at":"2026-08-07T11:17:39.355374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:17:35.688187Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.688187Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:e8e1437c0e8c016fad7d46565eaeed154b4ec2909650850d0a17fd11db7e98a0","observation_id":"8464f160-98df-44bf-a350-34d01d7099c4","resolution":{"observed_at":"2026-08-07T11:17:35.688187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:39.136187Z","title":"Open R1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"336a6e1f-236e-41ea-9824-2b921cf0e884","year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.748480Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:ae4c710d214f802c3a0133350b8528e58f7fb3b2e37441543b68f47461982cae","observation_id":"f7a0a08d-cd12-478e-94a9-8fe0c635447b","resolution":{"observed_at":"2026-08-07T11:17:39.178562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:17:35.844677Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.844677Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:2ab20795c788935d54a0d271e5602a95020210bec4b4b4cdc7601b7a40986871","observation_id":"163b6c39-173b-471c-97ca-30fa4813e820","resolution":{"observed_at":"2026-08-07T11:17:35.844677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:35.915418Z","title":"LoRA: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.915418Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:e2e84787709acbbafe86664cd2938b7c53b455a9074f92025b2834daa16012dc","observation_id":"137bfbff-2e0c-4154-9c23-4dc4cf1a7223","resolution":{"observed_at":"2026-08-07T11:17:35.915418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T11:17:35.974206Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:35.974206Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:74ef59e49476bcd3f785005caa2ea3112ec4d3337ec27ffd862d4a4b4ed8f2f7","observation_id":"d0645b24-f71c-4b25-ac34-00e689d4bd09","resolution":{"observed_at":"2026-08-07T11:17:35.974206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T11:17:36.055511Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models.arXiv preprint arXiv:2309.14509, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.055511Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:95074ef3115c2ca70b314e9dff8f46be31855dbb036b5d090a5ff285e2dbe552","observation_id":"00f6e65c-b6cf-49aa-b499-8622ddf57d83","resolution":{"observed_at":"2026-08-07T11:17:36.055511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:17:36.128133Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.128133Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:f6f2c76581424724b7a87161c134e1055f3796c6ff101ebccaa5509949726f44","observation_id":"086568fe-f6f3-4c8c-a795-a0e1505e67d2","resolution":{"observed_at":"2026-08-07T11:17:36.128133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T11:17:36.163838Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.163838Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:794671adbdc8f1d34c7e0248ef2054f63cc8e8ef450f5fa8959499002aa0abc7","observation_id":"37f2a0e6-6d34-467f-a0e2-17d06eb95adb","resolution":{"observed_at":"2026-08-07T11:17:36.163838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:36.196477Z","title":"Reducing activation recomputation in large transformer models.Proceedings of Machine Learning and Systems, 5:341–353, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.196477Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:b393be9c095ccbe21cd78856793db6b9cd08fc1ce040af1d47d0bcc53c522b15","observation_id":"089afc44-e368-44c4-baf6-206e03341c14","resolution":{"observed_at":"2026-08-07T11:17:36.196477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-08-07T21:53:35.875689Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-07T11:17:36.286634Z","title":"Llms can easily learn to reason from demonstrations structure, not content, is what matters!arXiv preprint arXiv:2502.07374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.286634Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:1e8e1a23af2b92e0531f2ff1ccd86597c2c1502540411c58eaa72c5191c988d6","observation_id":"a6807fc2-30f5-4543-adcc-fee13ca3928d","resolution":{"observed_at":"2026-08-07T11:17:36.286634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T11:17:36.333821Z","title":"Sequence paral- lelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.333821Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:8d51ba48ad2f35e62440646abf1984dc32a2958b7dcbdf5e73b4d01527f8dea1","observation_id":"8316e377-e9ca-4bba-99fc-99db6a301f91","resolution":{"observed_at":"2026-08-07T11:17:36.333821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:36.385160Z","title":"Dora: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.385160Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:71e47c0230a774d2c6b865fd26bced9e6a8840e7c7a384f210c147267cdf4f68","observation_id":"887dea13-d8a6-49b2-9740-74bebe2764af","resolution":{"observed_at":"2026-08-07T11:17:36.385160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:17:36.477447Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.477447Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:4aba9e3ed791697eb95f5014fa84cf387bc829dde35e7dee390df000f8fc6d52","observation_id":"50d9730b-4d11-47c8-a9b9-7758bdcc25c5","resolution":{"observed_at":"2026-08-07T11:17:36.477447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:38.934400Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"3db890df-8c57-42e7-8dbe-8bfa0b4e6f62","year":null},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.541873Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:5388780edc16b8635890ca7dfe5598d8083f1cb3e34d5d4c8dbea043f585c489","observation_id":"79163203-8efb-4bb8-93d8-a2665bac4e20","resolution":{"observed_at":"2026-08-07T11:17:39.038667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15892","last_updated":"2024-11-09T15:09:19Z","snapshot_observed_at":"2026-08-04T17:15:26.191935Z","submitted_at":"2024-07-22T01:52:30Z","title":"Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training","version":4},"cited_work":{"arxiv_id":"2407.15892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15892","snapshot_observed_at":"2026-08-07T11:17:38.259642Z","title":"Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training","venue":"cs.LG","work_id":"a28fbda1-0351-4e85-a78f-fac8848a5439","year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.607266Z"},"links":{"cited_paper":"/paper/2407.15892","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:88dc1d501e17eb89e7f26b7dac8ee298032189eba0980324475df8d66d6bc819","observation_id":"49f1994c-d8bb-466b-9e92-d43852bea311","resolution":{"observed_at":"2026-08-07T11:17:38.316476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:38.787625Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"13a4e399-9c92-41df-8eea-e08a4cee09cf","year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.665209Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:f0007c91d6075d11b983888debaf8bca2f493b37880a9902ab4d814479bd47bc","observation_id":"01b96a64-3913-4b31-a9bb-d1fc8f587624","resolution":{"observed_at":"2026-08-07T11:17:38.876655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:38.650042Z","title":"BAdam: A memory efficient full parameter optimization method for large language models.Advances in Neural Information Processing Systems, 37:24926–24958, 2024","venue":null,"work_id":"9b2f9698-827c-4037-9fa9-59323d9ce858","year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.746379Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:abe051b60e29116ef04d1f9d655b1879595b55dec462b75c2ea4d4d3a4bd3fa1","observation_id":"78272862-aaf3-446c-b57a-a27a901ed0f9","resolution":{"observed_at":"2026-08-07T11:17:38.708583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T11:17:36.799677Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.799677Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:f30a202592fba5135d58028f292a88ec4d867636844b36bf22c3be64f6f3578e","observation_id":"34fa238d-a471-43bd-a4d6-a585d826c1dc","resolution":{"observed_at":"2026-08-07T11:17:36.799677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:36.886052Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.886052Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:a05c7e84dcd2e4635053d37e3ff723dff7768df98cdb82493acb41e213de3b8f","observation_id":"c193548a-cf57-444e-b2fe-ac0e8e932dbe","resolution":{"observed_at":"2026-08-07T11:17:36.886052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-07-06T10:33:17.427927Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-07T11:17:36.966763Z","title":"Zero-offload: Democratizing billion-scale model training.arXiv preprint arXiv:2101.06840, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.966763Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:4c22bb852330f5a164e12f0f13ac4b73c42362c11ad90290188466b36f2e68f9","observation_id":"9d289a50-00d3-4dce-b04c-517a15cf9229","resolution":{"observed_at":"2026-08-07T11:17:36.966763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:37.023132Z","title":"Trl: Transformer reinforce- ment learning.https://github.com/huggingface/trl, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.023132Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:9564144c27bf2165597c301861ae1acc5a5eab652c2401068ae0b38b80f57933","observation_id":"6697b25b-72d6-4cdc-8f82-5d4f06db5907","resolution":{"observed_at":"2026-08-07T11:17:37.023132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T11:17:37.098700Z","title":"Reinforcement learning for reasoning in large language models with one training example.arXiv preprint arXiv:2504.20571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.098700Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:564a422bd778f8a8a73ea77741dae511a407f22d61b85c5644b8abe586a528a0","observation_id":"cdfea2b3-f913-47a6-91c9-b5bd5bc89388","resolution":{"observed_at":"2026-08-07T11:17:37.098700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:37.164737Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.164737Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:69b89928b2dcbd49fd6fdab02d2234c125adb50d762ccb3c9fdd160ff7b5d572","observation_id":"25a6b81e-8e1b-4b63-8f3c-48e89439d978","resolution":{"observed_at":"2026-08-07T11:17:37.164737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T11:17:37.235199Z","title":"Light-R1: Curriculum sft, dpo and rl for long cot from scratch and beyond.arXiv preprint arXiv:2503.10460, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.235199Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:92b66f3bde45cb2c1e143e7921334e9d030ce2e2997e3b15755689e4d8fabbb0","observation_id":"ec882aa4-946f-4bb0-924e-0ca1319546e9","resolution":{"observed_at":"2026-08-07T11:17:37.235199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:17:37.353885Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.353885Z"},"links":{"citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:0d57377a1afd7b06269206698ba2534b1ac908b73a1a5535a81420102165e519","observation_id":"fa423f3e-9149-42c9-a053-5cb9e27e2421","resolution":{"observed_at":"2026-08-07T11:17:37.353885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:17:37.412316Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.412316Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:ada96a16e21e18ec804cb5c13383a7cc1f59e1b24567ca8683373646e5594a56","observation_id":"a44ae5d8-89b5-4f76-af6a-b4533feaaa14","resolution":{"observed_at":"2026-08-07T11:17:37.412316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T11:17:37.467105Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.467105Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:89b926f59baabb5da59533d533c95652aad955e38617278b932c2474f948436c","observation_id":"4b920b99-fc98-4c36-a5b0-9bf5f8dff18a","resolution":{"observed_at":"2026-08-07T11:17:37.467105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T11:17:37.522534Z","title":"Demystifying long chain-of-thought reasoning in llms.arXiv preprint arXiv:2502.03373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.522534Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:dabaf451b68f0d36ad4b306950a98dbf6ddb20d8c79489653920eeb35adf04ff","observation_id":"093f2445-c691-4609-9806-fc18ae34f1e2","resolution":{"observed_at":"2026-08-07T11:17:37.522534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:17:37.613949Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.613949Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:5a6e6789db9d38b10c57f2d312b1c80fb3c6df42fcd3090979f6c1bb94af5d41","observation_id":"1d3da582-05a5-4454-8db3-fe030f03c885","resolution":{"observed_at":"2026-08-07T11:17:37.613949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T11:17:37.752175Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.752175Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:928769b680f1e34e1d7b74e65da879d92893b4d155bdb35f82574d38e4682eac","observation_id":"845f3139-907f-4c8e-81c9-188f64adc75d","resolution":{"observed_at":"2026-08-07T11:17:37.752175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T11:17:37.858509Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.858509Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:59ad9a52e2e1d795d3444cbdd7f33c5f5a6a0ef6abdb8bb743f15fb18d2fe714","observation_id":"3bf4bb70-508f-4448-abfc-112fdcb2806b","resolution":{"observed_at":"2026-08-07T11:17:37.858509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T11:17:37.970701Z","title":"Model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.970701Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:ddd18204b3b3d499b42087ee48b17f8a700880d3dda05317341be4fa073a1cc5","observation_id":"dd5fd556-5431-438c-8f11-dcfccaef5494","resolution":{"observed_at":"2026-08-07T11:17:37.970701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.03077."}