{"as_of":"2026-08-07T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca45ea8bd2e94ff96c6015270f6cf9b7e8f23f6ffba2ae9307e36a87e7808f10","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:56.938309Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":55,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:c5a58ecea4079b76c2315d94d56fe53e351e6a247cefd481080551a3409bd564","observation_id":"23efadb5-39a3-4564-96fa-05b7a3431662","resolution":{"observed_at":"2026-05-13T23:19:46.710952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:234566ca7bedc82d76731cd5faca92db5ca9ea6af8fbab579d7bd5092901b0a2","observation_id":"5a993fea-6aa6-42ef-ab50-9fbbc7c9c94a","resolution":{"observed_at":"2026-05-10T22:46:40.812840Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:20.027659Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2304.11277"},"observation_digest":"sha256:785676f6bc1e5e430ef47b79d79a008f57a9fa17acac99f5fb1c1e6a7cce9b2f","observation_id":"e3169a5d-bf93-40d0-b0f4-2af1cd38ed7b","resolution":{"observed_at":"2026-05-12T04:15:20.079382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T19:28:28.201789Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2310.01889"},"observation_digest":"sha256:9be9a3d996c0e985bac7dedf30fbf5f02603411f5122d29dc8b5e529d678e8f2","observation_id":"cba71a44-9ef7-4c93-85f8-b271d07509da","resolution":{"observed_at":"2026-05-12T19:28:28.258495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:b711f996f59400d6ef8aefb2a615d8279a7532c286fdf6d14edf9365c3caaaf9","observation_id":"691d0b08-e397-4417-a090-0b2b67fe70d9","resolution":{"observed_at":"2026-05-18T10:31:03.874186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:150e529cca7e2bb6e3a4a310cb7fcd91e207d743efdb941b3d02798d2458643e","observation_id":"6c13164e-123b-4bca-9aec-6c6c21527958","resolution":{"observed_at":"2026-05-22T23:07:14.441789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2504.09844","last_updated":"2026-04-27T14:30:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T03:31:22Z","title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T21:12:22.201810Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2504.09844"},"observation_digest":"sha256:0d5d96fb9f9244b2d29b33bb9e074ca5a72771fd2fc3206e41def7249a468e8e","observation_id":"c7c516d8-0213-4b7b-924e-62402ec17b46","resolution":{"observed_at":"2026-05-22T21:15:09.565107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2504.10013","last_updated":"2026-05-07T10:54:03Z","snapshot_observed_at":"2026-07-06T21:08:57.447867Z","submitted_at":"2025-04-14T09:17:47Z","title":"Training LLMs on HPC Systems: Best Practices from the OpenGPT-X Project","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T21:04:11.859563Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2504.10013"},"observation_digest":"sha256:cd81739279c674dda9b1cb89fac1ece6bc5fb76fe9ea45503cb46286519e7ece","observation_id":"6cf91668-8f56-47a2-9b89-8c4066a1a1d8","resolution":{"observed_at":"2026-05-22T21:05:09.524204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-07T00:30:56.938309Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.938309Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:b3b57359898b893ccfe821dc650a1bd56d9e754ef38e6b67738d643c6d689b7d","observation_id":"05cf9cdb-0e18-47b3-8b67-145d5b4307f4","resolution":{"observed_at":"2026-08-07T00:30:56.938309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T20:47:28.846985Z","title":"Reducing activation recomputation in large transformer models, 2022.URL https://arxiv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-06T20:38:11.691093Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.846985Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:766f238b31a3ef69091fda6b966f5340df4bd81b2696fe2ef926acf300c2f17b","observation_id":"56cb0289-22aa-40af-8685-0e92e1d25712","resolution":{"observed_at":"2026-08-06T20:47:28.846985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T16:20:28.750375Z","title":"https://doi.org/10.48550/ARXIV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14000","last_updated":"2025-07-23T15:07:06Z","snapshot_observed_at":"2026-08-06T16:09:26.330988Z","submitted_at":"2025-07-18T15:14:56Z","title":"Photonic Fabric Platform for AI Accelerators","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:20:28.750375Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.14000"},"observation_digest":"sha256:ea3db7a8436c0cd7cd49e0c67cc4ee37eadbb544cd51fcbad4e9c2ef990f20aa","observation_id":"ab079cb3-4ffd-4be9-96f4-13dc456ad6b2","resolution":{"observed_at":"2026-08-06T16:20:28.750375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T14:45:20.758677Z","title":"McAfee,MichaelAndersch,MohammadShoeybi,andBryanCatanzaro","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18006","last_updated":"2025-07-24T00:49:48Z","snapshot_observed_at":"2026-08-06T14:36:28.203700Z","submitted_at":"2025-07-24T00:49:48Z","title":"Unlock the Potential of Fine-grained LLM Serving via Dynamic Module Scaling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:20.758677Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.18006"},"observation_digest":"sha256:0bf8331d9af97d934e8fe85986f4c2aa45348f64b60006a1f4e4f884747a73ab","observation_id":"29feca7a-4ba7-4d1c-870a-f553e4fdb36f","resolution":{"observed_at":"2026-08-06T14:45:20.758677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:715feb1b3cac70776a88d27d34b84328ad2f740c7a2cedfa504b0f337f89ac30","observation_id":"2310f253-5f7a-4c4f-b35c-c2b3c75cacbb","resolution":{"observed_at":"2026-05-18T20:41:50.661629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-07-06T22:24:38.247543Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:60e05d063286a912969246b10a5de2c0c3a6a0209dc37508295030a2a5ef0333","observation_id":"1599cf5d-4ed1-448c-9376-f64d6d84fb65","resolution":{"observed_at":"2026-05-18T18:51:45.802088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2509.21275","last_updated":"2026-04-25T07:48:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-25T15:01:25Z","title":"InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T14:04:31.017142Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2509.21275"},"observation_digest":"sha256:e889db2a9b1f6fb5be14cf7ef78655d84a4ffd57dea2df9980e19675b6c3cc2e","observation_id":"e994574e-f6b7-406f-9d3a-6140912e951d","resolution":{"observed_at":"2026-05-18T14:06:27.277349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-03T22:28:46.339471Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-06T01:01:29.510781Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.339471Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:217dee55b1bbc50014f6462b0a06b66aa162fe99482e7606ea7cc6254450e4b2","observation_id":"e0fd7fba-7f23-4a1d-9063-d8b7f7787471","resolution":{"observed_at":"2026-08-03T22:28:46.339471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:7424e917e1ea651be8e490e071cfd124345492657b17069d9e4fc873e312129a","observation_id":"12782da5-748a-4f8c-b556-b6116eb53347","resolution":{"observed_at":"2026-05-18T01:40:42.615219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T21:11:49.812534Z","title":"Reducing activation recomputation in large transformer models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-07T08:21:33.678621Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.812534Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:1b14ba43fb2091817831298f722060b8a97cce6f894fa97d969f3f3615aaab09","observation_id":"25597e34-7a25-4688-a37f-d0c9ac86d4fa","resolution":{"observed_at":"2026-08-02T21:11:49.812534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T20:59:24.724128Z","title":"Langley, P","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.21788","last_updated":"2026-06-08T12:37:51Z","snapshot_observed_at":"2026-08-02T20:59:23.294747Z","submitted_at":"2026-02-25T11:11:53Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T20:59:24.724128Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2602.21788"},"observation_digest":"sha256:583b09c8eaec1375022b742c7fd5d9dc9519683c9e5a564c3e6cf22f3689a8bf","observation_id":"44a5279e-e3ff-4c8f-aa1e-c570a6561d63","resolution":{"observed_at":"2026-08-02T20:59:24.724128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2604.14561","last_updated":"2026-04-21T03:27:38Z","snapshot_observed_at":"2026-08-01T16:25:53.172850Z","submitted_at":"2026-04-16T02:43:06Z","title":"CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T10:23:19.236803Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2604.14561"},"observation_digest":"sha256:f800360e0d5f673f4a88dc6cdf4a7b4b9c99b477ed04bb60c93af085f7f57067","observation_id":"b2543f4e-0d6d-47cd-9f31-2669ecf6a87b","resolution":{"observed_at":"2026-05-10T10:24:20.560853Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2604.21428","last_updated":"2026-04-23T08:45:38Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T08:45:38Z","title":"Decoupled DiLoCo for Resilient Distributed Pre-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:20:21.090246Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2604.21428"},"observation_digest":"sha256:3e85122133391f1881e5f8dcf732a1a79d7dae5a836e48d32fe096505d042da1","observation_id":"570aaedd-d074-469c-ab98-e26078be9db5","resolution":{"observed_at":"2026-05-09T22:49:15.683024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2604.27085","last_updated":"2026-04-29T18:26:13Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:26:13Z","title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T10:37:22.251566Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2604.27085"},"observation_digest":"sha256:9bd595924d92907ce8659f0e4e51eba38d1b7912b934855070925c05c63a8b51","observation_id":"01b389ca-2465-4751-aeb1-731fb8ab9bfa","resolution":{"observed_at":"2026-05-12T09:31:26.808957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2605.05049","last_updated":"2026-05-06T15:47:14Z","snapshot_observed_at":"2026-08-02T19:55:25.393308Z","submitted_at":"2026-05-06T15:47:14Z","title":"Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T17:04:02.418499Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2605.05049"},"observation_digest":"sha256:f0fad94bd360aa2ce37f429355d536de85ab2448def99063570ed2480a6201b1","observation_id":"626393f0-cf06-4885-8f1f-e18a1ba5e337","resolution":{"observed_at":"2026-05-11T17:51:07.974000Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:8c8fd7c0f7500de56da2f796753846875600dad5efc9fe44865902234f2bc721","observation_id":"8b587fa3-48b1-4433-8d58-456f31566783","resolution":{"observed_at":"2026-05-12T02:06:15.053308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2605.20799","last_updated":"2026-05-20T06:44:25Z","snapshot_observed_at":"2026-08-03T14:15:31.862715Z","submitted_at":"2026-05-20T06:44:25Z","title":"Instant GPU Efficiency Visibility at Fleet Scale","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T02:43:09.077121Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2605.20799"},"observation_digest":"sha256:43372d626d49fa673db145af75eddc07e567603bfa6fc6a2f70f50ec8ba1d190","observation_id":"99be7701-2fdb-4847-b917-fbca9bf0467d","resolution":{"observed_at":"2026-05-21T02:43:54.741443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T20:20:53.599064Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:adf90869317bb978ed54e1027680482a23b723537a68d53f22d80f9ffe1a363e","observation_id":"f8d65840-193a-47fe-8a6c-495610f149ab","resolution":{"observed_at":"2026-07-02T20:37:22.529353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-07-15T10:54:16.434702Z","title":"Li, B., Chen, F., Huang, Z., Wang, L., and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T10:54:16.434702Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:e8fe882c9ad404c22defcfa5121c951523592cec8f041febc4192467a29dcb11","observation_id":"0c493078-284b-448d-af6a-03d51e9a3e57","resolution":{"observed_at":"2026-07-15T10:54:16.434702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T12:13:46.609563Z","title":"Li, B., Chen, F., Huang, Z., Wang, L., and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.609563Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:b87887405160e29eba7c4383641403824e53571511c52dfff2854dcc65f8a945","observation_id":"8d91bf9b-23e5-4d5a-98c0-f507144fa1b9","resolution":{"observed_at":"2026-08-02T12:13:46.609563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T04:42:46.028286Z","title":"Reducing acti- vation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14172","last_updated":"2026-07-15T09:42:59Z","snapshot_observed_at":"2026-08-04T18:29:49.457691Z","submitted_at":"2026-07-15T09:42:59Z","title":"The Cost and Network Limits of Space-Based AI Compute","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:46.028286Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.14172"},"observation_digest":"sha256:ca9c9a4e066181bfddbdbe677d40bed5f60944e4b38e54ae42379a3caaa4883b","observation_id":"faa07337-c6ca-41dc-a16f-b1657d9e5bd8","resolution":{"observed_at":"2026-08-02T04:42:46.028286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T00:41:45.462772Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14952","last_updated":"2026-07-27T13:07:41Z","snapshot_observed_at":"2026-08-06T11:27:51.606337Z","submitted_at":"2026-07-16T13:00:32Z","title":"LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:45.462772Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.14952"},"observation_digest":"sha256:ccea9197842e7018cb1eaa1c3fc5919219f51b03e949323339befed06d4afec4","observation_id":"a31fe6a3-500d-467f-9f96-095c7d2e8fba","resolution":{"observed_at":"2026-08-02T00:41:45.462772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-01T17:32:37.263658Z","title":"Li, J., Jiang, Y ., Zhu, Y ., Wang, C., and Xu, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-05T08:18:07.080959Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.263658Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:1846cb74dc8cf7357d49885b6c92d0031e6fc05ca3216388f5c91e03803fedfd","observation_id":"58bacf8a-3c44-477c-ad9a-a7ebad505fcb","resolution":{"observed_at":"2026-08-01T17:32:37.263658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-01T06:48:44.020572Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-07T09:56:42.250730Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":194,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:44.020572Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:0788216ef9d27c3e6a5860bbca00f0a65250647111d3e27612532b3204fff100","observation_id":"2b777e7d-da11-4b27-8c90-c084795671c0","resolution":{"observed_at":"2026-08-01T06:48:44.020572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2205.05198/citation-record","integrity":"/paper/2205.05198/integrity","json":"/paper/2205.05198/citation-record.json","paper":"/paper/2205.05198"},"outbound":[],"paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2205.05198."}