{"as_of":"2026-08-10T10:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a6056e9a4cce142c58b85fdf8db66e10bc00f600f8cb68997c6da3aa0738634","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:46:02.126145Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T02:13:56.272752Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-09T11:46:02.126145Z","title":"Lita: Accelerating distributed training of sparsely activated models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02581","last_updated":"2025-02-04T18:56:00Z","snapshot_observed_at":"2026-08-10T04:00:05.634150Z","submitted_at":"2025-02-04T18:56:00Z","title":"Hecate: Unlocking Efficient Sparse Model Training via Fully Sharded Sparse Data Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:46:02.126145Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2502.02581"},"observation_digest":"sha256:386f76e22118fbebb8920d75a0df50647860f734a7d3a9378f4db3d88d77e608","observation_id":"15cb7034-8632-49a7-a5aa-702d4b59136f","resolution":{"observed_at":"2026-08-09T11:46:02.126145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":"2210.17223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating distributed moe training and inference with lina","venue":null,"work_id":"659beb77-755d-4b3c-a6cc-026d49f4f040","year":2024},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-02T13:33:38.641735Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T02:11:11.003259Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:54f14f91f4b7c3202abff50018728ccff17a47ebc52294b99f83175adb04e643","observation_id":"e4379065-3428-4c30-b2d0-51dd727e2d74","resolution":{"observed_at":"2026-05-21T02:13:56.276567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-02T13:33:43.332523Z","title":"Accelerating distributed moe training and inference with lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-02T13:33:38.641735Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T13:33:43.332523Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:7143131f3459ea0464f9d2820c7d1dd400e1eb27a582749b395a56d7dbb18463","observation_id":"03aac04b-6f71-4126-abb2-c62e37533f11","resolution":{"observed_at":"2026-08-02T13:33:43.332523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-07-11T08:35:22.347459Z","title":"Accelerating distributed moe training and inference with lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05116","last_updated":"2026-07-06T14:06:25Z","snapshot_observed_at":"2026-08-02T18:01:37.878392Z","submitted_at":"2026-07-06T14:06:25Z","title":"Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T08:35:22.347459Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.05116"},"observation_digest":"sha256:b97eea21e0750777265ed0399be3154bd11218ff66ba57d18cc687bb73a1bd94","observation_id":"ec240a9f-f052-489b-8326-02fd2c750cf7","resolution":{"observed_at":"2026-07-11T08:35:22.347459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-01T19:10:31.791494Z","title":"Accelerating Distributed MoE Training and Inference with Lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17074","last_updated":"2026-08-02T01:52:26Z","snapshot_observed_at":"2026-08-06T23:24:49.347377Z","submitted_at":"2026-07-19T04:45:01Z","title":"ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:10:31.791494Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17074"},"observation_digest":"sha256:cf9772c7af4451e5843ef8cb789e0ef5b76aa3897a705119cf4c0f8fee8450f6","observation_id":"9a146c72-edcd-43d5-8420-1dc1c82bd154","resolution":{"observed_at":"2026-08-01T19:10:31.791494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-04T04:18:21.111262Z","title":"Accelerating Distributed MoE Training and Inference with Lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17074","last_updated":"2026-08-02T01:52:26Z","snapshot_observed_at":"2026-08-06T23:24:49.347377Z","submitted_at":"2026-07-19T04:45:01Z","title":"ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:18:21.111262Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17074"},"observation_digest":"sha256:0c4b326cbe49691715fd1e7e74e0763f9e418f1f4bbfe7ab7ee41ad8860cbb3b","observation_id":"2a710d4d-b218-4bf5-b68f-68f05679743b","resolution":{"observed_at":"2026-08-04T04:18:21.111262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-01T17:32:37.332884Z","title":"Liu, H., Zaharia, M., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-09T22:07:57.255278Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.332884Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:a7e856d1d3d9198ac810acd7d728785d42484fc9fe42aab89f75f4fad55fbbba","observation_id":"6dc5e0e5-a6ad-4b3e-9656-cdfaab448c1c","resolution":{"observed_at":"2026-08-01T17:32:37.332884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2210.17223/citation-record","integrity":"/paper/2210.17223/integrity","json":"/paper/2210.17223/citation-record.json","paper":"/paper/2210.17223"},"outbound":[],"paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T14:12:29.636948Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2210.17223."}