{"as_of":"2026-08-14T02:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:167474f947e333f0078d4a4f6cf2772f74085126babfbdfaaf3809515c5897a4","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:26:40.947047Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20501/citation-record","integrity":"/paper/2412.20501/integrity","json":"/paper/2412.20501/citation-record.json","paper":"/paper/2412.20501"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-10T23:26:40.885542Z","title":"S., and Ramjee, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.885542Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:42f8a549f0727b14c3085f3f23fd8eabe8b0bdd3bb322d5612a37e758035a00c","observation_id":"da331029-1b30-41aa-aeb3-45a1bcdb499c","resolution":{"observed_at":"2026-08-10T23:26:40.885542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-13T22:53:37.044169Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-10T23:26:40.892673Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.892673Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:e172f1cbc542f9bd902e57aa2f66118b70df53184e331f40aae49605619d20fd","observation_id":"a5f4dc18-95ea-4a28-9974-68f6d893dfd0","resolution":{"observed_at":"2026-08-10T23:26:40.892673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:26:40.896082Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.896082Z"},"links":{"citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:3070ce66bfdb7b0c76d93e84107f1ee412e4580afc3211d5282eb358e54e32b0","observation_id":"7d92dbd6-302e-4cc5-ae6d-11bc11f9ff21","resolution":{"observed_at":"2026-08-10T23:26:40.896082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01738","last_updated":"2024-11-04T01:40:38Z","snapshot_observed_at":"2026-08-12T22:08:40.955987Z","submitted_at":"2024-11-04T01:40:38Z","title":"xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01738","snapshot_observed_at":"2026-08-10T23:26:40.909528Z","title":"xdit: an inference engine for diffusion transformers (dits) with massive parallelism","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.909528Z"},"links":{"cited_paper":"/paper/2411.01738","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:3aa1c0ab0b5659d67343830564a9c6b02b6cfbb75bda26e2de3c5eb7579c107a","observation_id":"6036e558-6c65-4d71-b8d5-6af65e7ad13a","resolution":{"observed_at":"2026-08-10T23:26:40.909528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18485","last_updated":"2024-06-26T16:51:28Z","snapshot_observed_at":"2026-08-12T23:34:19.076045Z","submitted_at":"2024-06-26T16:51:28Z","title":"LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18485","snapshot_observed_at":"2026-08-10T23:26:40.913166Z","title":"Loong- train: Efficient training of long-sequence llms with head- context parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.913166Z"},"links":{"cited_paper":"/paper/2406.18485","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:614fd2ce61645fab3dd714992dcc17cb23bc2de32f15b9ab6fdb6cf9f0125c76","observation_id":"a16b346b-bd2d-496b-862d-91d13444cc93","resolution":{"observed_at":"2026-08-10T23:26:40.913166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-12T23:36:32.131457Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-10T23:26:40.923614Z","title":"Ren, J., Rajbhandari, S., Aminabadi, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.923614Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:94ac7c75f1410de51e14ad4e29215291148cdc57e822c833eb47bbc369644006","observation_id":"49cb6187-7629-4237-b25b-f64a9d094499","resolution":{"observed_at":"2026-08-10T23:26:40.923614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04093","last_updated":"2025-02-09T16:06:53Z","snapshot_observed_at":"2026-08-12T23:38:33.123157Z","submitted_at":"2024-08-07T21:16:55Z","title":"Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04093","snapshot_observed_at":"2026-08-10T23:26:40.930670Z","title":"Tree attention: Topology-aware decoding for long-context attention on gpu clusters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.930670Z"},"links":{"cited_paper":"/paper/2408.04093","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:0e24b1bdda302f18a21451ba4588169e5af1481c1e8826d0e43e66e8cbfd188c","observation_id":"7913a40f-7474-4fcc-8851-4e5844d968f8","resolution":{"observed_at":"2026-08-10T23:26:40.930670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13588","last_updated":"2024-11-18T02:49:23Z","snapshot_observed_at":"2026-08-13T14:59:12.832950Z","submitted_at":"2024-11-18T02:49:23Z","title":"Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13588","snapshot_observed_at":"2026-08-10T23:26:40.934049Z","title":"Unveiling redundancy in diffusion transformers (dits): A systematic study.arXiv preprint arXiv:2411.13588,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.934049Z"},"links":{"cited_paper":"/paper/2411.13588","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:3e83ed9039d2aaeb1ec6199f07d00e7abab8a6365ee82156ded75c6b5e069c15","observation_id":"2eef1bec-a9f9-4916-97bd-5e3d8bae575a","resolution":{"observed_at":"2026-08-10T23:26:40.934049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T23:26:40.937348Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.937348Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:423408eb899a3c589896a6ec67feca1b6784a1f991a461dcc40d0a9afd491b76","observation_id":"3bfd4ff6-2d09-44e7-b018-90d4fc4d2fc6","resolution":{"observed_at":"2026-08-10T23:26:40.937348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-13T23:09:00.124751Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-10T23:26:40.943865Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.943865Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:da458d74990b669a8107220faa2d79a91ba2547740cbded277c5aef3c12cbf2a","observation_id":"f5b1654a-de27-4a0f-9265-64732f89b371","resolution":{"observed_at":"2026-08-10T23:26:40.943865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:26:41.142026Z","title":"You can have an appendix here","venue":null,"work_id":"02bb593b-01aa-4528-a72a-ff755f216550","year":2025},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.947047Z"},"links":{"citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:f93ad6b98ff5b894355eb1f3f400b4bc8c460e7ff243add8d3c68a83cdfa3cd5","observation_id":"b1ea6812-da04-473a-8205-64a3fb3c26c6","resolution":{"observed_at":"2026-08-10T23:26:41.146603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T23:26:40.902785Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.902785Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:cfdb267bafa68938c07aa6b018e9743146de9131ffa93fb8ba2638f5b24eeb77","observation_id":"39a86d49-20b0-49d8-8368-0e9abb0648fe","resolution":{"observed_at":"2026-08-10T23:26:40.902785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-10T23:26:40.920005Z","title":"Sequence parallelism: Long sequence training from system perspec- tive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.920005Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:13185eeeedea38bf3cb33314bfd310466e81bfe805a5ebeb0d0aee7ba0b34a68","observation_id":"8458eaa1-9adc-4e5f-8467-ae62d3015b5d","resolution":{"observed_at":"2026-08-10T23:26:40.920005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-12T22:08:38.058102Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-08-10T23:26:40.940418Z","title":"Context parallelism for scalable million- token inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.940418Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:a725ce4e263d8b7ef33af29749b514903cfdcceae8d254e31f140d427dbdd0f8","observation_id":"a2ef2535-1694-474a-893d-13668dfb5593","resolution":{"observed_at":"2026-08-10T23:26:40.940418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-13T22:49:56.824755Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-10T23:26:40.916583Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Song, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.916583Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:bc7ef7cc91ed06f308df04e585605c9872e4d4538067c817f04b5e314e952170","observation_id":"c264a08b-d356-4150-9852-c9575d148781","resolution":{"observed_at":"2026-08-10T23:26:40.916583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09149","last_updated":"2024-01-22T06:40:44Z","snapshot_observed_at":"2026-08-13T04:40:41.857015Z","submitted_at":"2024-01-17T11:47:59Z","title":"InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09149","snapshot_observed_at":"2026-08-10T23:26:40.899331Z","title":"Internevo: Efficient long-sequence large language model training via hybrid parallelism and redundant sharding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.899331Z"},"links":{"cited_paper":"/paper/2401.09149","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:17ac616c3d6cf2dc444236c4da075e1c62fbe8bc52e86f090b9de9c7f2925f9a","observation_id":"fa18bbc3-f7d0-45c5-afa0-a46305ab6548","resolution":{"observed_at":"2026-08-10T23:26:40.899331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T23:26:40.927027Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.927027Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:807a6d7f78ee81484b33dfc9ac32603401a0055aa71739486321fc0da21a3e78","observation_id":"febc9a7e-5730-45f4-81f1-e45cc476bc97","resolution":{"observed_at":"2026-08-10T23:26:40.927027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-10T23:26:40.889229Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.889229Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:ec23d007137e5cbd274645bb7fcfd632df1a4715ac63c6de851a08253a594705","observation_id":"3079faf4-e985-4460-8757-2575b41a88bd","resolution":{"observed_at":"2026-08-10T23:26:40.889229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-13T21:15:18.571730Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-10T23:26:40.905999Z","title":"and Zhao, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.905999Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:3bd5b55a307c6293b8a5de5953c9b48ceb84e3d4252d053586ab7e325664b54b","observation_id":"c3eea437-b1cd-433d-a163-85554eb40f67","resolution":{"observed_at":"2026-08-10T23:26:40.905999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-13T21:16:15.485596Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2412.20501."}