{"as_of":"2026-08-07T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bb8f80e37cdb634266c9bb2e29a6c6dab2c87f28ef9a1855846ee454036b56b","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:57.837571Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:11:48.095184Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13996","snapshot_observed_at":"2026-08-02T21:11:48.095184Z","title":"Arctic long sequence training: Scalable and efficient training for multi-million token sequences, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-07T08:21:33.678621Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.095184Z"},"links":{"cited_paper":"/paper/2506.13996","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:e4b1c9797baf5f0ce423c36474868613b254c0dc184adbffe9b631dee1c4383e","observation_id":"f68b75ca-1d76-4926-b339-af583cf09ac8","resolution":{"observed_at":"2026-08-02T21:11:48.095184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13996/citation-record","integrity":"/paper/2506.13996/integrity","json":"/paper/2506.13996/citation-record.json","paper":"/paper/2506.13996"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T00:30:56.473062Z","title":"Ring attention with blockwise transformers for near-infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.473062Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:0e81e74e40148d00ee6c402516feeba9fe9f5eb32c974fbff8d4b29c0dbaa837","observation_id":"40367eda-1cf8-4460-8d22-17d7ec9af6c2","resolution":{"observed_at":"2026-08-07T00:30:56.473062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T00:30:56.703220Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.703220Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:b6eb8cae9f161a264c90c8d42897cbdc6884aeebcb26f9e3de7981b48e0e987c","observation_id":"97957d92-9f4b-4298-bd7f-1b37b5bb3d3a","resolution":{"observed_at":"2026-08-07T00:30:56.703220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-07T00:30:56.938309Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.938309Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:b3b57359898b893ccfe821dc650a1bd56d9e754ef38e6b67738d643c6d689b7d","observation_id":"05cf9cdb-0e18-47b3-8b67-145d5b4307f4","resolution":{"observed_at":"2026-08-07T00:30:56.938309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-07-06T11:13:16.760403Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T00:30:57.105856Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.105856Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:54021c785bac5cba9bc087e401626804082864ae351eba0a6351b851a1c387f1","observation_id":"9786b61f-a944-441d-8011-a71f08b31f5f","resolution":{"observed_at":"2026-08-07T00:30:57.105856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03294","last_updated":"2024-03-31T21:11:08Z","snapshot_observed_at":"2026-08-07T06:18:54.374420Z","submitted_at":"2023-10-05T03:47:57Z","title":"DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03294","snapshot_observed_at":"2026-08-07T00:30:57.230466Z","title":"Distflashattn: Distributed memory-efficient attention for long-context llms training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.230466Z"},"links":{"cited_paper":"/paper/2310.03294","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:0d761c0fb4246e4e87c8d23156789781af2ca43448feba9e0db81189ba9eb446","observation_id":"c4684dc0-5dd9-423f-b97d-1dde205943c9","resolution":{"observed_at":"2026-08-07T00:30:57.230466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-07-06T16:48:16.671370Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-07T00:30:57.281690Z","title":"Striped attention: Faster ring attention for causal transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.281690Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:5926398919c3678b9824ebf08efdd453172271435abd491936e6ab759870b995","observation_id":"4cf2c8ee-c34e-4f71-a054-6050612b2b61","resolution":{"observed_at":"2026-08-07T00:30:57.281690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T00:30:57.362359Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.362359Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:55b48895d2f90a81e783dc7900795443bac0739c6920a6663efd5b628d6aa36e","observation_id":"9d9e0298-ab80-4bb6-8aba-7eadca48f60d","resolution":{"observed_at":"2026-08-07T00:30:57.362359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-07T00:30:57.510416Z","title":"Usp: A unified sequence parallelism approach for long context generative ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.510416Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:189ee109a976f044edda66d9b92f7a67e0ba568942a7157453fd5ca164bff15c","observation_id":"3d33a8a5-0944-4486-9b2e-f980395fd95f","resolution":{"observed_at":"2026-08-07T00:30:57.510416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18485","last_updated":"2024-06-26T16:51:28Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T16:51:28Z","title":"LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18485","snapshot_observed_at":"2026-08-07T00:30:57.602093Z","title":"Loongtrain: Efficient training of long-sequence llms with head-context parallelism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.602093Z"},"links":{"cited_paper":"/paper/2406.18485","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:5bacbd2f12313af43a101afd0f9b370fc274ea72613c0f9cb33b1108a025e63b","observation_id":"56cbb9a8-b30c-4123-8fb3-a696124d50ce","resolution":{"observed_at":"2026-08-07T00:30:57.602093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-07-06T19:33:26.078722Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-07T00:30:57.663570Z","title":"Liger kernel: Efficient triton kernels for llm training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.663570Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:ce43d70a6da565ade2469f79648cbf95f33dff27c03abb8b3d23816968c0e3f2","observation_id":"6ba52778-8e90-491f-a35d-e8bedcd57bde","resolution":{"observed_at":"2026-08-07T00:30:57.663570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:58.261343Z","title":"Datasets: A community library for natural language processing,","venue":null,"work_id":"0da76f72-97dd-4d0e-b207-272cc6633bb3","year":2021},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.742706Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:fbc5b0bb544cf55f531b3fbd918c3a58091e449953f75e15f54fb2a712f12d5f","observation_id":"dd1ff85e-5006-4493-ac35-44d4b275336f","resolution":{"observed_at":"2026-08-07T00:30:58.266013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:58.244659Z","title":"ArcticTraining: Simplifying and accelerating post-training for large language models,","venue":null,"work_id":"2b67dd33-80b8-42c6-bfee-13d1daec5254","year":2025},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.748571Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:b004bbfcadec9ce1ab70f6207cb3c44caf232c656bbb1935255639c3c8e5cad0","observation_id":"fd638e83-7865-4f24-b9b6-1e00006d7cc6","resolution":{"observed_at":"2026-08-07T00:30:58.250240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:57.786155Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.786155Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:9673818baccedfd462bec7c5b727b0e12df5f0552dd871345f9391c0fae1fb2d","observation_id":"622566c1-dd5c-448b-9a97-c4efac6fe13b","resolution":{"observed_at":"2026-08-07T00:30:57.786155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:58.221001Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"1425d405-7667-40c9-ae04-374a062d7721","year":2020},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.805996Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:39a9cf98222810f94b0c79fd32f0f76c8f89caa7cbb947d690663b3ddf5c513a","observation_id":"ca5d832f-b92b-41ae-a63e-3db5732e2929","resolution":{"observed_at":"2026-08-07T00:30:58.233466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-07T00:30:57.822249Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.822249Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:e1ac7ec1a7cced885b6b308c33ee6bf586f055d02f2c3e4d7fe100f6703539eb","observation_id":"26203125-424d-4dc8-ac48-05c8314a0a3d","resolution":{"observed_at":"2026-08-07T00:30:57.822249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T00:30:57.832992Z","title":"Bloom: A 176b-parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.832992Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:032ceaf3c784abe6b3e379a36bccf2a9bb1ede00f958e2a4f36369b3957f408d","observation_id":"19ccebd1-f9c0-45b0-91fe-236b9f080d5e","resolution":{"observed_at":"2026-08-07T00:30:57.832992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14489","last_updated":"2024-01-30T21:26:09Z","snapshot_observed_at":"2026-07-06T17:20:37.280501Z","submitted_at":"2024-01-25T19:50:31Z","title":"The Case for Co-Designing Model Architectures with Hardware","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14489","snapshot_observed_at":"2026-08-07T00:30:57.837571Z","title":"The case for co-designing model architectures with hardware,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.837571Z"},"links":{"cited_paper":"/paper/2401.14489","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:58dde3157cc727ccdf70277a3a6817e54d4604636243db10b04ebf46ec5d4419","observation_id":"b8d73282-b716-4528-85b6-a516858600f3","resolution":{"observed_at":"2026-08-07T00:30:57.837571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2506.13996."}