{"as_of":"2026-08-11T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d1b297fe0b9a5a7c8bf5dc955aaa67cd1bc806625ac42551d5ddf3e2b41de21","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:20:59.524307Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.01951/citation-record","integrity":"/paper/2501.01951/integrity","json":"/paper/2501.01951/citation-record.json","paper":"/paper/2501.01951"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1603.04467","last_updated":"2016-03-16T16:57:12Z","snapshot_observed_at":"2026-07-06T04:49:28.300758Z","submitted_at":"2016-03-14T20:50:20Z","title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.04467","snapshot_observed_at":"2026-08-10T22:20:58.638267Z","title":"Tensorflow: Large-scale machine learning on heteroge- neous distributed systems","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.638267Z"},"links":{"cited_paper":"/paper/1603.04467","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:7b490940c2dfc83859f3f515254f4bf7d5f95156dac105ad8c50ee42094e3062","observation_id":"e46f153a-cbc2-41ab-a5d4-9574eadb917d","resolution":{"observed_at":"2026-08-10T22:20:58.638267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.644621Z","title":"Hardware accel- eration of graph neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.644621Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:915abe39a1a2c3fd1ccd6d6d2ed93e9565234f42a113b480734f2912cc3d0b3b","observation_id":"d1e82c4d-b714-4cef-9c66-73a1f30aeca0","resolution":{"observed_at":"2026-08-10T22:20:58.644621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13466","last_updated":"2023-12-10T14:56:21Z","snapshot_observed_at":"2026-08-11T02:20:46.170362Z","submitted_at":"2023-08-25T16:10:44Z","title":"Staleness-Alleviated Distributed GNN Training via Online Dynamic-Embedding Prediction","version":2},"cited_work":{"arxiv_id":"2308.13466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.13466","snapshot_observed_at":"2026-08-10T22:21:01.145893Z","title":"Staleness-Alleviated Distributed GNN Training via Online Dynamic-Embedding Prediction","venue":"cs.LG","work_id":"bdea936e-7a0a-485c-b997-27898ee0d09f","year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.649361Z"},"links":{"cited_paper":"/paper/2308.13466","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:31556d7f9a1d861f5792e2611839c780876a30758630f2494fa8c4cb03dfb5d1","observation_id":"3274501f-e5b7-4c70-bcbc-1033bcbd988a","resolution":{"observed_at":"2026-08-10T22:21:01.160978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.654099Z","title":"Pathways: Asynchronous distributed dataflow for ml","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.654099Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:db12bfe6f4f93a26acdf4c642bc00ebf512dd314b6edf2029de5a99889d97b23","observation_id":"e5c96f4a-508a-488b-b7d7-4d6674f254ff","resolution":{"observed_at":"2026-08-10T22:20:58.654099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00057","last_updated":"2022-10-02T16:07:10Z","snapshot_observed_at":"2026-07-06T13:16:05.426540Z","submitted_at":"2022-05-31T18:44:53Z","title":"Distributed Graph Neural Network Training with Periodic Stale Representation Synchronization","version":2},"cited_work":{"arxiv_id":"2206.00057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00057","snapshot_observed_at":"2026-08-10T22:21:01.069056Z","title":"Distributed Graph Neural Network Training with Periodic Stale Representation Synchronization","venue":"cs.LG","work_id":"d8cb039d-0171-45c4-87bd-c8a5b4a3b4b3","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.660107Z"},"links":{"cited_paper":"/paper/2206.00057","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:e6edb1cdf2b8f5f4c334290967cfc4a88f10cb25874acfaed454fa6161e9bc25","observation_id":"7245acf2-1add-4ba5-ab32-3ce031209894","resolution":{"observed_at":"2026-08-10T22:21:01.078748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.668865Z","title":"Dygnn: Algorithm and architecture support of dynamic pruning for graph neural net- works","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.668865Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:698aa59161930bf27f7a77784ab3f7d5121a083a685b44ebe5df9a6a5714cf0b","observation_id":"81aa9a1f-8148-42a1-84b6-a145c7c84759","resolution":{"observed_at":"2026-08-10T22:20:58.668865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.675487Z","title":"Graph representation learning: a survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.675487Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:ea301f8af3b35c8f38c02d8e92d836323b10f45d1cca369ed9ef8f52ce25b6d1","observation_id":"e951a0f3-c9e8-4880-a91d-24df1d98633d","resolution":{"observed_at":"2026-08-10T22:20:58.675487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01274","last_updated":"2015-12-03T22:49:21Z","snapshot_observed_at":"2026-08-10T17:07:11.368395Z","submitted_at":"2015-12-03T22:49:21Z","title":"MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01274","snapshot_observed_at":"2026-08-10T22:20:58.681665Z","title":"Mxnet: A flexible and efficient machine learning library for heterogeneous distributed systems","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.681665Z"},"links":{"cited_paper":"/paper/1512.01274","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:824dbb85232f9ea641a8767b222d76644f1881c0bcaaff7417d04817c83c3a7f","observation_id":"a900a66c-853e-4fec-9910-0341ed2d1577","resolution":{"observed_at":"2026-08-10T22:20:58.681665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.687941Z","title":"Rubik: A hierarchical architecture for efficient graph neural network training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.687941Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:04b196ae47df568ff0063c32071ae5ad7f6b931b980455237d2f76e379892564","observation_id":"265278f4-a1ab-461e-9c46-63c206dce10c","resolution":{"observed_at":"2026-08-10T22:20:58.687941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.695359Z","title":"The bandwidth problem for graphs and matrices—a survey","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.695359Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:9ea60a8232e9b3c8c93c7e0b77cd0170f002fdc824ba1778f3ddb5cf00444626","observation_id":"f1dfa1f2-f91a-4a3a-a18f-fe22a470139d","resolution":{"observed_at":"2026-08-10T22:20:58.695359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.708177Z","title":"Reducing the bandwidth of sparse symmetric matrices","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.708177Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:9a30dfb1c5102a8494a102d74e04263684e41fecaf7417e4f74f829448359a18","observation_id":"900c8cf9-a8eb-46bf-8836-e18c85657a60","resolution":{"observed_at":"2026-08-10T22:20:58.708177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.715413Z","title":"Hardware acceleration of sparse and irregular tensor computations of ml models: A survey and insights","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.715413Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:e3694bf0b7333067340e6d00af1dae2bfe9759ed2abeaf49fa3c9571efca7a5e","observation_id":"3c5b3bc4-135b-4bf8-b227-e9ef3509220c","resolution":{"observed_at":"2026-08-10T22:20:58.715413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-11T09:09:15.043235Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-10T22:20:58.720956Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.720956Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:6d48322c61d79f9f9c8ec341c8810c99eff2e8668f8d0e6a1e85aef5fbe87907","observation_id":"83f84d04-ce23-495c-a5e2-f37b943c8769","resolution":{"observed_at":"2026-08-10T22:20:58.720956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05609","last_updated":"2021-06-10T09:26:56Z","snapshot_observed_at":"2026-07-06T11:17:55.927608Z","submitted_at":"2021-06-10T09:26:56Z","title":"GNNAutoScale: Scalable and Expressive Graph Neural Networks via Historical Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05609","snapshot_observed_at":"2026-08-10T22:20:58.727043Z","title":"Gn- nautoscale: Scalable and expressive graph neural networks via histori- cal embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.727043Z"},"links":{"cited_paper":"/paper/2106.05609","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:2f3a7eeb69965bad2e0164cfc8edc4e02bfa049c303d19bd569822e5bc3ca0fa","observation_id":"f0113c2e-fa3e-447b-9752-ce615c03ca3a","resolution":{"observed_at":"2026-08-10T22:20:58.727043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.733191Z","title":"Tlpgnn: A lightweight two- level parallelism paradigm for graph neural network computation on gpu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.733191Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:642601f0717e035d803e871e660693de36bda146d76046d57fa7e815febfdb39","observation_id":"0651de6c-f8bc-472b-a9f7-ca3cd0786885","resolution":{"observed_at":"2026-08-10T22:20:58.733191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.743084Z","title":"P3: Distributed deep graph learning at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.743084Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:e77c714851134ffb4b56099585d021d436e022f116179c2e727ad800c64aa902","observation_id":"bef0258f-a19c-4a8e-a99f-3d345a12397c","resolution":{"observed_at":"2026-08-10T22:20:58.743084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07977","last_updated":"2022-03-07T01:17:27Z","snapshot_observed_at":"2026-07-06T10:49:45.926090Z","submitted_at":"2021-03-14T17:14:13Z","title":"Understanding the Design-Space of Sparse/Dense Multiphase GNN dataflows on Spatial Accelerators","version":3},"cited_work":{"arxiv_id":"2103.07977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.07977","snapshot_observed_at":"2026-08-10T22:21:00.906707Z","title":"Understanding the Design-Space of Sparse/Dense Multiphase GNN dataflows on Spatial Accelerators","venue":"cs.DC","work_id":"ad07ed51-1313-436b-a21f-d47a03f90821","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.752395Z"},"links":{"cited_paper":"/paper/2103.07977","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:71e6d5cac48b5b19f0f4f67ab3898dabd59b3a8c76fd8062c85ef00e7bf102e7","observation_id":"ddb8f1d2-30fb-4930-9934-726a654b23c9","resolution":{"observed_at":"2026-08-10T22:21:00.914804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.760701Z","title":"Awb-gcn: A graph convolutional network accelerator with runtime workload rebalancing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.760701Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:3af0f725065d425c01c3160f226199905c09df3dcf32d88d0f3b168f15589d42","observation_id":"d30f8ec6-fb6f-4104-a5b9-a4e777ee08fb","resolution":{"observed_at":"2026-08-10T22:20:58.760701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.766827Z","title":"I-gcn: A graph convolutional network accelerator with runtime locality enhancement through islandization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.766827Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:0fe7dfaad37e21b63121dbf5e2ed2da597030bf112aa60c626154c2c434f3787","observation_id":"1dd4b653-4062-4595-b968-f8daa27bc569","resolution":{"observed_at":"2026-08-10T22:20:58.766827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.774832Z","title":"Data-efficient graph grammar learning for molecu- lar generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.774832Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f83b496d68d3ef106d3eb01b050f178e399d206a910b212caa83cd6f789c7a3d","observation_id":"1c2058d1-43f6-4f1b-8054-b49b731acfe8","resolution":{"observed_at":"2026-08-10T22:20:58.774832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.110872Z","title":"Inductive represen- tation learning on large graphs","venue":null,"work_id":"f345bc41-542f-4ed8-b9c5-0d63b23893ee","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.781848Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:8058c0a8272c79a9940036853d9c63980444e174309069a96758a22b6090f17f","observation_id":"d8d3438f-15be-42e0-a6a2-0bfc03f92b6c","resolution":{"observed_at":"2026-08-10T22:21:03.123452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-02T18:12:03.258298Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-10T22:20:58.789532Z","title":"Pipedream: Fast and efficient pipeline parallel dnn training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.789532Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:bbb81383a0291a1641a55991df1a106ec9cef2fc630fb32d87751a903331c011","observation_id":"0d08922e-937e-4b4f-8655-414507764227","resolution":{"observed_at":"2026-08-10T22:20:58.789532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00687","last_updated":"2021-02-25T02:06:27Z","snapshot_observed_at":"2026-08-09T05:17:43.055948Z","submitted_at":"2020-05-02T03:09:50Z","title":"Open Graph Benchmark: Datasets for Machine Learning on Graphs","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00687","snapshot_observed_at":"2026-08-10T22:20:58.810421Z","title":"Open graph benchmark: Datasets for machine learning on graphs","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.810421Z"},"links":{"cited_paper":"/paper/2005.00687","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:270b5cedaea4864ca49e0663fcc0b788a5404ec40b2efd86fbe10fa4722b2d66","observation_id":"08c0e4d8-8ded-42a4-9b44-487f86315581","resolution":{"observed_at":"2026-08-10T22:20:58.810421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.081311Z","title":"Recurrent graph convolutional network-based multi- task transient stability assessment framework in power system","venue":null,"work_id":"455ecc13-56d4-46a7-bb7c-e82a3bdc3c2d","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.818299Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:79069eb42d649835df68cc2c70abf39162c46895ef8c6a3f4950fde92acd5d33","observation_id":"2934b5ee-8cfa-4ddd-b4e2-150e63895935","resolution":{"observed_at":"2026-08-10T22:21:03.089163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.058160Z","title":"Wisegraph: Optimizing gnn with joint workload partition of graph and operations","venue":null,"work_id":"428ffba1-6180-4c26-92f1-4a268d1ceb10","year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.824637Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:2f11e8be99d747635ee94f323b48915f112b206c1788ede61381fec6af0d30a2","observation_id":"a1a61f0a-9771-4f8d-a903-250a3949abdb","resolution":{"observed_at":"2026-08-10T22:21:03.063763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.020377Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"0951ede7-0932-45d2-bc6a-3142f064f9d9","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.838644Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:9cefc95fd53b8e66f1dcfa426fc97586882f5f2973d82db3ae0fcaaf27162b00","observation_id":"6638afb0-1936-4479-aa12-9858d99f90fc","resolution":{"observed_at":"2026-08-10T22:21:03.032277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17145","last_updated":"2024-10-28T13:44:30Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T21:32:51Z","title":"GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17145","snapshot_observed_at":"2026-08-10T22:20:58.846946Z","title":"Graphpipe: Improving performance and scala- bility of dnn training with graph pipeline parallelism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.846946Z"},"links":{"cited_paper":"/paper/2406.17145","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:fd21ff8374c9a5807b3fab2a92c216b1a900a4ff4dd55cff9fc97e8a79d9aa30","observation_id":"f14914ea-757b-45b0-943f-5a814e9559a1","resolution":{"observed_at":"2026-08-10T22:20:58.846946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.994864Z","title":"A survey on knowledge graphs: Representation, acquisition, and applications","venue":null,"work_id":"88b58ff0-9468-4f7a-b5ca-17a2e0aaf1a5","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.854077Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:05cf67b2805389d19fc540e9035ad0648aff2e5cf87d7190f7447458107d1a94","observation_id":"f248b074-31e6-4104-8cdd-03d2de625884","resolution":{"observed_at":"2026-08-10T22:21:03.001880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.959340Z","title":"Improving the accuracy, scalability, and performance of graph neural networks with roc","venue":null,"work_id":"388e4cca-4d0f-4b6d-a4e1-fe332ebb1b49","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.863186Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:9a33b63a31b09bffb2e1d66cb381e5e9d55939935182dcc96e80f777aef70da8","observation_id":"142d96fe-707b-4af4-9af6-a87d94a4b1ab","resolution":{"observed_at":"2026-08-10T22:21:02.968211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.904428Z","title":"A survey of frequent subgraph mining algorithms","venue":null,"work_id":"1861a054-46aa-461e-919e-192eba606669","year":2013},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.886748Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:28dbb0472c55decb83dddb5768dd49b87e5581b4fc0c1361be9e899ec2465282","observation_id":"5cb57111-06b2-458e-b51d-5e2e411d6aed","resolution":{"observed_at":"2026-08-10T22:21:02.919586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.868678Z","title":"A unified architecture for accelerating distributed{DNN} 12 training in heterogeneous{GPU/CPU} clusters","venue":null,"work_id":"d5fb0b92-e45a-4223-a351-1d5cf382a73f","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.896202Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:fe022a61c6d4bb5cf2e3e48dc96573691f08a1b928947f6ceeb40d1193aaa8aa","observation_id":"d437af7a-a70e-4d9e-b372-789939763c32","resolution":{"observed_at":"2026-08-10T22:21:02.882539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.811629Z","title":"In-datacenter performance analysis of a tensor pro- cessing unit","venue":null,"work_id":"32f2dec6-8475-4b29-ab6e-faa5bcf27c6d","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.902286Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:b25a30acbef6e43e8fa0efa605b0e5d205e854b4eca5dca911b3787f771d8c33","observation_id":"b146ab98-1339-41ed-90f4-9b76ef32289f","resolution":{"observed_at":"2026-08-10T22:21:02.832052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.774075Z","title":"A fast and high quality multilevel scheme for partitioning irregular graphs","venue":null,"work_id":"bc1462d2-9dc0-4fbe-a3cf-10aa45329250","year":1998},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.914019Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:ed7a90bc03f5a5fe06dfc435574df05fe8f1dabc1ff6eed0a27507dba980a778","observation_id":"28f1548c-1997-4beb-a394-7b0b5127c010","resolution":{"observed_at":"2026-08-10T22:21:02.780051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13828","last_updated":"2020-07-30T07:55:13Z","snapshot_observed_at":"2026-08-11T17:07:18.630254Z","submitted_at":"2020-07-27T19:44:51Z","title":"GRIP: A Graph Neural Network Accelerator Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.13828","snapshot_observed_at":"2026-08-10T22:20:58.923650Z","title":"Grip: A graph neu- ral network accelerator architecture","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.923650Z"},"links":{"cited_paper":"/paper/2007.13828","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:ff3b2eae17377f0caf2eeab83a7c5e362aa08355abdb896be479d6246357c37a","observation_id":"6c470d37-b9c5-47f3-a7b0-fe75d054b951","resolution":{"observed_at":"2026-08-10T22:20:58.923650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02907","last_updated":"2017-02-22T09:55:36Z","snapshot_observed_at":"2026-07-06T05:10:16.862707Z","submitted_at":"2016-09-09T19:48:41Z","title":"Semi-Supervised Classification with Graph Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.02907","snapshot_observed_at":"2026-08-10T22:20:58.935775Z","title":"Semi-supervised classification with graph convolutional networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.935775Z"},"links":{"cited_paper":"/paper/1609.02907","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:8d68e26e4fc6d4d9464c62119e7671ecfe114550967b439c8ab9e5721eca008e","observation_id":"91348ac9-53df-4283-873e-70b652883e0b","resolution":{"observed_at":"2026-08-10T22:20:58.935775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.747023Z","title":"What is twitter, a social network or a news media? InProceedings of the 19th international conference on World wide web , pages 591–600, 2010","venue":null,"work_id":"63647529-d39e-4be9-b27e-0af2919903fc","year":2010},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.941452Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:d4570e86a52227afa87112e3da0b3294ab5606ae83a3586da70b9d06022d6b23","observation_id":"a5d7c67d-96a7-4e0e-b2ef-24c445cd0cf4","resolution":{"observed_at":"2026-08-10T22:21:02.754966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.724760Z","title":"Maeri: En- abling flexible dataflow mapping over dnn accelerators via reconfig- urable interconnects","venue":null,"work_id":"5fd48328-b7ef-4a58-8d60-9205daab47a3","year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.950658Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:8ed59e2dc87dbc905729f0d82aa64104f0cd117c27de8b9d68df8f4159ea4737","observation_id":"3916394e-82ee-480e-bedd-607716e4c432","resolution":{"observed_at":"2026-08-10T22:21:02.734867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-10T22:20:58.960665Z","title":"Gshard: Scaling giant models with conditional com- putation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.960665Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:b387375bd3816de80dadb1d4ea230d103ca2e5316431c1e84669a11b4a64a2de","observation_id":"85fb448c-8df8-422d-988e-ffa53899f03c","resolution":{"observed_at":"2026-08-10T22:20:58.960665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.699964Z","title":"Gcnax: A flexible and energy-efficient accelerator for graph convolutional neural networks","venue":null,"work_id":"dfcf4685-608b-4acd-a81f-28f9c66bfa86","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.972154Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:53019407fc16617d40a47b98473aa1c7717d3688a8ff7915bbf7b3908d73210e","observation_id":"98849045-ddec-4b1f-894f-826f52e88d75","resolution":{"observed_at":"2026-08-10T22:21:02.708857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-10T22:20:58.982658Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.982658Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:df7f4768294c6531217bd56d124fecf82663c7e6c7cc335bb84ffec79de3c0d7","observation_id":"20c0a3b0-4df1-44ea-969e-fd7f04788898","resolution":{"observed_at":"2026-08-10T22:20:58.982658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.994822Z","title":"Terapipe: Token-level pipeline parallelism for training large-scale language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.994822Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:7cf1c15c2f130823f3eecf265d4d8c2cc7c18a63126efb5a093b119bc85f9924","observation_id":"1f7421e2-3a0b-4046-a37d-35e0bb6c16f3","resolution":{"observed_at":"2026-08-10T22:20:58.994822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.623713Z","title":"Engn: A high-throughput and energy-efficient accelerator for large graph neural networks","venue":null,"work_id":"47649fd0-b90f-4615-b236-c4ba7ea04fa6","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.016949Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4cf795898c0198bb6034d19d05af4cfb595fc0ebd834f7395ac769acda1405bd","observation_id":"93ebb486-cd12-4c14-9b03-f6eab1dcceb8","resolution":{"observed_at":"2026-08-10T22:21:02.632501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.590366Z","title":"Nvidia tesla: A unified graphics and computing architecture","venue":null,"work_id":"341bafda-5715-4954-9df1-580af451a766","year":2008},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.030513Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:5f61249bcbbc6cddd1253156e99a7981ad1d5272f1e06d52cc619ad050468c9f","observation_id":"09e3ddb5-ab50-4d88-8004-35428db90a82","resolution":{"observed_at":"2026-08-10T22:21:02.600956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.558592Z","title":"Flexflow: A flexible dataflow accelerator architecture for convolutional neural networks","venue":null,"work_id":"b1708fb7-ce95-4f34-8fd9-7b80c48abed6","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.036783Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c2bddca973251930e120c3929d857f4a7487dff21de278eb9e9a788971c82d0d","observation_id":"f98bde13-0dfc-4c84-a9cf-127e05790520","resolution":{"observed_at":"2026-08-10T22:21:02.566211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.526659Z","title":"NeuGraph: Parallel deep neural network compu- tation on large graphs","venue":null,"work_id":"7520b40a-720d-4b39-831b-9ac1b85a51f4","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.042719Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:65aa526bfa48fd902e0f3201e8eaa6145df4a42b760eb444d44cae149e14fa3c","observation_id":"490a054e-7ca0-47b8-a6ec-a7c963318011","resolution":{"observed_at":"2026-08-10T22:21:02.539604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.480059Z","title":"All-to-all personalized communication on multi- stage interconnection networks","venue":null,"work_id":"d9c5d6f1-d518-4516-96d2-c057d959b087","year":2003},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.052182Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:176374602fba498ef37f4ec647c8fcc72cfb244c501532299d53c4c8e12ae952","observation_id":"3978c9b6-e306-4a77-a3a5-a133550d9d88","resolution":{"observed_at":"2026-08-10T22:21:02.494811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.438807Z","title":"Distgnn: Scalable distributed training for large-scale graph neural networks","venue":null,"work_id":"0c5e9515-4b53-4213-a9ee-f31bb393c762","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.060848Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:19a2c68b9ba518e841f6da684e721f00ffa8436ae821057b51fc8fc8eaf77d0e","observation_id":"6d4041c5-da6a-4b3c-8e98-05c1ebcd25d3","resolution":{"observed_at":"2026-08-10T22:21:02.447000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.406834Z","title":"Device placement optimization with reinforce- ment learning","venue":null,"work_id":"a52007df-f88d-4f43-b639-b6b2b24ae898","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.071093Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c27d81c44ccef4caf92a76611337c4771b20258c56b1563bec7bb57d424d277a","observation_id":"319f8905-194a-4c96-ad85-c462b4296de9","resolution":{"observed_at":"2026-08-10T22:21:02.418462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.351221Z","title":"Pipedream: generalized pipeline parallelism for dnn train- ing","venue":null,"work_id":"14188431-5ae8-42dc-9a29-9b69bf33cffd","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.079779Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:50f617578ff210db582344fc6579afe37f268eca0ad5535fa4a86fc62a29ed1e","observation_id":"7e67f924-4cc7-4353-9169-75fe0bf7825b","resolution":{"observed_at":"2026-08-10T22:21:02.364659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.320446Z","title":"Sancus: staleness-aware communication-avoiding full- graph decentralized training in large-scale graph neural networks","venue":null,"work_id":"ecad89fd-55c0-4d7c-a613-f7f8ff7df0e0","year":1937},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.089244Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:58ceeed0a11a18ab388579f9d51ac69156ee6e83fc105786e0bd66bf96dca34d","observation_id":"380d05f5-8580-4e87-a785-73e8589f9d2d","resolution":{"observed_at":"2026-08-10T22:21:02.329105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.254209Z","title":"Fusedmm: A unified sddmm-spmm kernel for graph embedding and graph neural networks","venue":null,"work_id":"935977dd-e2a3-482c-b17a-0abdeec013af","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.095388Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:2f3fad75f97e1a69dc4afe3ef884e9329465f611d8574d3aaf82764b9b6a724a","observation_id":"65ed8d03-a91c-4252-b1bc-862013eeeb46","resolution":{"observed_at":"2026-08-10T22:21:02.274773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-08-10T10:53:30.608519Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-10T22:20:59.102053Z","title":"Deepspeed-moe: Advancing mixture-of-experts infer- ence and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.102053Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:183b9be6f0a235d4503330f1bf600c1b81f7a7f2d8f9dd9b339b4c8cf749355b","observation_id":"65049aef-5c7d-47a0-8808-3a526f13763e","resolution":{"observed_at":"2026-08-10T22:20:59.102053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:59.108981Z","title":"Zero: Memory optimizations toward training trillion parameter mod- els","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.108981Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:09b6b1475a41b0b34c7b58e7676b94180ef1684909dd0bca41132b2174d95b0b","observation_id":"d8d35684-346d-4b49-8179-8094f6c961fa","resolution":{"observed_at":"2026-08-10T22:20:59.108981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08202","last_updated":"2022-03-13T14:51:02Z","snapshot_observed_at":"2026-07-06T12:08:53.711797Z","submitted_at":"2021-11-16T03:07:01Z","title":"Learn Locally, Correct Globally: A Distributed Algorithm for Training Graph Neural Networks","version":4},"cited_work":{"arxiv_id":"2111.08202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08202","snapshot_observed_at":"2026-08-10T22:21:00.470777Z","title":"Learn Locally, Correct Globally: A Distributed Algorithm for Training Graph Neural Networks","venue":"cs.LG","work_id":"dc71aea4-17dd-4955-9686-6d3d189e8420","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.117725Z"},"links":{"cited_paper":"/paper/2111.08202","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c4fd1edfc545152cb54a27bbe704f70fe97909e1ebe254fd51f1c34213bba5c6","observation_id":"0a54229d-d23b-45e2-aa60-ea1ce748168c","resolution":{"observed_at":"2026-08-10T22:21:00.479807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.181681Z","title":"Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters","venue":null,"work_id":"2f1a4e68-e9ed-43fc-8082-2fb1813a9d43","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.126880Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:5b090b7e1add240fbb6a0a3a789d707a1c72c5ba2db24c99b4e5c1dd992e48dd","observation_id":"8ee42cb4-310e-4f75-a8ce-ece2d785048e","resolution":{"observed_at":"2026-08-10T22:21:02.207314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.138351Z","title":"Algorithms for scheduling independent tasks","venue":null,"work_id":"8552209c-0cb6-4d16-8bb4-edfb6ff22e57","year":1976},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.137669Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:014b0389a304718ea97b764c798791718b5e0a92cc9015616ea72134b419508f","observation_id":"c1a24337-6191-4dc6-9f27-cccc75667223","resolution":{"observed_at":"2026-08-10T22:21:02.150058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05799","last_updated":"2018-02-21T04:30:30Z","snapshot_observed_at":"2026-07-06T06:23:45.215820Z","submitted_at":"2018-02-15T23:36:51Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05799","snapshot_observed_at":"2026-08-10T22:20:59.150042Z","title":"Horovod: fast and easy dis- tributed deep learning in tensorflow","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.150042Z"},"links":{"cited_paper":"/paper/1802.05799","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a42c556ac40df88855ba7fae35c368ed88d369937a416889587833a8974dd7bb","observation_id":"9189f8bc-bdda-46c3-82ba-50abd2636540","resolution":{"observed_at":"2026-08-10T22:20:59.150042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.111802Z","title":"Mesh-tensorflow: Deep learning for supercomputers","venue":null,"work_id":"82cefb69-4bcc-4762-9a9e-7873f67ea4fa","year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.161184Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:88a3ce1812cc5d2b2c9a2f300a951ea647ffbed353dfdce57e1e99205b91f36e","observation_id":"8a880ebf-9a11-49ce-8d5a-8122d0ec683e","resolution":{"observed_at":"2026-08-10T22:21:02.121015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T22:20:59.171908Z","title":"Megatron-lm: Training multi- billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.171908Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:118aabca5743537da11b6043b66307cf06f7f16740beb95d666e4a1e48a122d0","observation_id":"40d352c3-29c8-49c0-aaf0-24533ccba5ce","resolution":{"observed_at":"2026-08-10T22:20:59.171908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.081827Z","title":"Synopsys design compiler","venue":null,"work_id":"43e718b4-50b3-4ae5-9981-2788f43dabd0","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.181983Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:79369884eb5e7fbd96a455bfa65f2c1aa3cc4323aea5375e5a3f097f8923ab68","observation_id":"f4e393ec-e838-4319-9bfb-d610633b99d3","resolution":{"observed_at":"2026-08-10T22:21:02.091513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.044894Z","title":"Dorylus: affordable, scalable, and accurate gnn training with distributed cpu servers and serverless threads","venue":null,"work_id":"a87197e5-6c7f-4cfc-98f4-ac9f00bb58ee","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.191790Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f41b863af5945a13088b7826e0da2e48eac44a357b957da535649cfdab639202","observation_id":"9cd0c7a5-d439-4097-8b41-4bdc58782e50","resolution":{"observed_at":"2026-08-10T22:21:02.056078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03300","last_updated":"2020-09-02T20:35:32Z","snapshot_observed_at":"2026-08-03T22:58:32.716336Z","submitted_at":"2020-05-07T07:45:09Z","title":"Reducing Communication in Graph Neural Network Training","version":3},"cited_work":{"arxiv_id":"2005.03300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.03300","snapshot_observed_at":"2026-08-10T22:21:00.309640Z","title":"Reducing Communication in Graph Neural Network Training","venue":"cs.LG","work_id":"2b7c0df6-5e31-4cda-9dbd-cbd291246c4c","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.199116Z"},"links":{"cited_paper":"/paper/2005.03300","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:674e0fade8b76842d7684425be15cbc692b8f2746e45a576dcc0a61f1d62cf16","observation_id":"a4d33c43-7177-494e-9fe3-f78a192c8417","resolution":{"observed_at":"2026-08-10T22:21:00.319132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-10T22:20:59.211695Z","title":"Graph attention networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.211695Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:52e95b6b3b13a0c189a58eadbee95fdc66ccaaa26b5f0d0117cf501058351d3c","observation_id":"7e7b17ad-ad80-418d-8ba4-b88d7e979228","resolution":{"observed_at":"2026-08-10T22:20:59.211695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.009770Z","title":"Adaptive message quan- tization and parallelization for distributed full-graph gnn training","venue":null,"work_id":"91563535-837e-4bad-8385-a63f4bf686ec","year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.225730Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:aaea763f74be4f7bba2a021fa2f14242bf05bf95e830c896b4cadcf90dc90a13","observation_id":"a770c2b6-0991-470a-9da3-cf781b35cc45","resolution":{"observed_at":"2026-08-10T22:21:02.016523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.961795Z","title":"BNS- GCN: Efficient full-graph training of graph convolutional networks with partition-parallelism and random boundary node sampling","venue":null,"work_id":"7317a43c-78ba-4ca9-acae-5a4d315efd3a","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.236611Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4935536fd3862be9d432d723ec55b3f5c762c4ed02653882674d8945cddf9549","observation_id":"f98be4b5-ff80-4c04-8aea-3ea9058a0a02","resolution":{"observed_at":"2026-08-10T22:21:01.978340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.920412Z","title":"Wolfe, Anastasios Kyrillidis, Nam Sung Kim, and Yingyan Lin","venue":null,"work_id":"6130fd57-7933-44c1-b91b-ac84cef671ea","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.251968Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:5e8fde18d9fea77def1db5d56f1332ff2f4d0195b8df55ce4b4e6049e364fc74","observation_id":"4587520d-d135-4149-b62d-8d95c9b56882","resolution":{"observed_at":"2026-08-10T22:21:01.933270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01040","last_updated":"2024-01-02T05:00:54Z","snapshot_observed_at":"2026-08-09T21:20:02.705268Z","submitted_at":"2024-01-02T05:00:54Z","title":"Towards Cognitive AI Systems: a Survey and Prospective on Neuro-Symbolic AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01040","snapshot_observed_at":"2026-08-10T22:20:59.261699Z","title":"Towards cognitive ai systems: a survey and prospective on neuro-symbolic ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.261699Z"},"links":{"cited_paper":"/paper/2401.01040","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:51f30a8b18fe74bc3953ad1747884dcc39a2d52b37654b9c9da1a72ff9340e76","observation_id":"1267dc0d-981c-4a75-82f6-b9fe313081cb","resolution":{"observed_at":"2026-08-10T22:20:59.261699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.880415Z","title":"Flexgraph: a flexible and efficient distributed framework for gnn training","venue":null,"work_id":"055efc7e-67f8-4b1e-b785-2c912c964041","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.271511Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a9b6d077b260938f48cec2af86d030ae63d076773cb86232d6805023c0aab763","observation_id":"835b8b77-41cd-4add-90f8-b678680feab1","resolution":{"observed_at":"2026-08-10T22:21:01.890633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.845620Z","title":"Supporting very large models using automatic dataflow graph partitioning","venue":null,"work_id":"43814238-ecf2-4969-a2d5-4ea181209041","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.278477Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:438a967f28c7c8c38684a9160e2362faceaa44c2195b67e9685bf195f25a5dbc","observation_id":"ca78c1c0-447d-4f2a-820c-5460288bee04","resolution":{"observed_at":"2026-08-10T22:21:01.856788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01315","last_updated":"2020-08-25T15:46:13Z","snapshot_observed_at":"2026-07-06T08:18:46.549511Z","submitted_at":"2019-09-03T17:10:28Z","title":"Deep Graph Library: A Graph-Centric, Highly-Performant Package for Graph Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01315","snapshot_observed_at":"2026-08-10T22:20:59.290357Z","title":"Deep graph library: A graph-centric, highly-performant package for graph neural networks","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.290357Z"},"links":{"cited_paper":"/paper/1909.01315","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f0ebf81868b53748671f4c800da570830900e655170726505b53771fad098225","observation_id":"5d290b2d-c270-4682-a6fe-5bba44dd1631","resolution":{"observed_at":"2026-08-10T22:20:59.290357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.779268Z","title":"Neutronstar: distributed gnn training with hybrid dependency management","venue":null,"work_id":"fbbb5920-263a-44c5-87ce-f039c7212da6","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.298190Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:223b6ae9f0a1fe85d15ec71bef9432fe0d8d2e1f4a07fd8f0aca58317542f145","observation_id":"9362a877-359f-4af1-817d-259a0283cdaa","resolution":{"observed_at":"2026-08-10T22:21:01.824164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.06608","last_updated":"2021-06-20T04:49:17Z","snapshot_observed_at":"2026-08-05T15:43:12.960253Z","submitted_at":"2020-06-11T16:58:10Z","title":"GNNAdvisor: An Adaptive and Efficient Runtime System for GNN Acceleration on GPUs","version":3},"cited_work":{"arxiv_id":"2006.06608","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.06608","snapshot_observed_at":"2026-08-10T22:21:00.110301Z","title":"GNNAdvisor: An Adaptive and Efficient Runtime System for GNN Acceleration on GPUs","venue":"cs.DC","work_id":"b3ed07d2-8cae-4c66-9bbc-9d84ab79a2b1","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.304951Z"},"links":{"cited_paper":"/paper/2006.06608","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:d5447f971d90bff395f57a36f60722f8508cb8779c42561e18d7c516d9ca1666","observation_id":"6da99ef0-b5b7-497b-981c-529d4695541d","resolution":{"observed_at":"2026-08-10T22:21:00.130736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.735498Z","title":"how graph neural networks go beyond weisfeiler-lehman?","venue":null,"work_id":"d2718b4a-cd2e-4072-85b5-c2e068a6a34b","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.315146Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a629c26b82a041caa695bebb0a07e210f0ad7865ef4ee007e9f97cc64b63ee63","observation_id":"04ef5575-beb6-448a-97d3-5e090e4976d7","resolution":{"observed_at":"2026-08-10T22:21:01.748058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.713683Z","title":"A comprehensive survey on graph neural networks","venue":null,"work_id":"0624e079-5e7a-4f5d-8e0d-86ad8b2910b5","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.322158Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:b106de33225b631e622b7fbaef84904ba5e27aae3e53a1879f9e860d421e8f74","observation_id":"58b0993f-a610-4bad-bfd2-354f248a1864","resolution":{"observed_at":"2026-08-10T22:21:01.719851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.676024Z","title":"Graph learning: A survey","venue":null,"work_id":"16d55b23-d3a9-4c3d-a84a-7c87ff6fe09d","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.328289Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:03b1ad7766725b3f95f06572846e88f5496bbaaead16367564d8c03ea8a4e077","observation_id":"211a737e-8cfb-4d27-babd-abbddde3e4ca","resolution":{"observed_at":"2026-08-10T22:21:01.683972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00826","last_updated":"2019-02-22T19:15:54Z","snapshot_observed_at":"2026-07-06T07:05:24.565760Z","submitted_at":"2018-10-01T17:11:31Z","title":"How Powerful are Graph Neural Networks?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00826","snapshot_observed_at":"2026-08-10T22:20:59.341765Z","title":"How powerful are graph neural networks? arXiv preprint arXiv:1810.00826, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.341765Z"},"links":{"cited_paper":"/paper/1810.00826","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c7a9e5e200ff31f4a6cbebebca471fbf91b3be69d2282155d3e754663dc21ac0","observation_id":"5ae5805c-cbec-452a-9a1d-dfdc7f84c6b4","resolution":{"observed_at":"2026-08-10T22:20:59.341765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-10T22:20:59.348880Z","title":"Gspmd: general and scalable parallelization for ml computation graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.348880Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:67732f3271ff30b9e1866b0decef899a52ef0b1a81357ac421a7271a755ba604","observation_id":"6f0b339d-f9ca-4afb-8fa3-9d4f07837ae4","resolution":{"observed_at":"2026-08-10T22:20:59.348880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.628992Z","title":"Hygcn: A gcn accelerator with hybrid architecture","venue":null,"work_id":"69eeb662-d13b-4c06-bafc-917a2a7ec87f","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.354654Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:306657571c04339030ecf6f51dafd8daf9e4f06ef029c0626fbe7907ef8038b3","observation_id":"1ae6a74e-3cab-4faa-bee7-24148c9f0f42","resolution":{"observed_at":"2026-08-10T22:21:01.640331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.602316Z","title":"Defining and evaluating network com- munities based on ground-truth","venue":null,"work_id":"b1928cac-dbc9-4edf-9f13-c252b0e3a2e2","year":2012},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.365045Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:294d06d7aef6bf4388f2e9884900eda26d9e9e8996b4b63a5db0e9f969f5ef53","observation_id":"1676b62e-3f12-4397-8fe0-94122f328542","resolution":{"observed_at":"2026-08-10T22:21:01.609457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.578323Z","title":"Optimal all-to-all personalized exchange in self-routable multistage networks","venue":null,"work_id":"f1e27520-a76d-4094-9d73-d293be2cd58b","year":2000},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.373416Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4767392f36dc7a9b52dfbcddf5de1b89b6658ca06f93b2e9ace7f8ba4342d1c9","observation_id":"b7be38e9-e0d2-4528-a1cd-512d6665a03c","resolution":{"observed_at":"2026-08-10T22:21:01.585646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.557532Z","title":"Graph convolutional neural networks for web-scale recommender systems","venue":null,"work_id":"423882d6-856d-444d-a497-2be218b72eb0","year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.380014Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:5c7e409c2e3d8e3c10cd684a654ae22a86355e35f194507ea0839f45e42f3ca1","observation_id":"36f83b9b-087d-4ade-a8c3-8a79ad3ff20a","resolution":{"observed_at":"2026-08-10T22:21:01.563709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11594","last_updated":"2025-03-09T02:58:24Z","snapshot_observed_at":"2026-07-06T12:21:20.815242Z","submitted_at":"2021-12-22T00:30:50Z","title":"GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design","version":3},"cited_work":{"arxiv_id":"2112.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11594","snapshot_observed_at":"2026-08-10T22:20:59.925146Z","title":"GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design","venue":"cs.AR","work_id":"25ff0a8d-23c0-4877-86b6-f8f075ca2237","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.388936Z"},"links":{"cited_paper":"/paper/2112.11594","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:40cf83d12df54bb5da6a08028b3803cef4211e5a7afe88c67819f9c228028b24","observation_id":"5761de6c-1f3a-4b74-9879-388143157dc2","resolution":{"observed_at":"2026-08-10T22:20:59.949902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.511107Z","title":"Graphact: Accelerating gcn training on cpu-fpga heterogeneous platforms","venue":null,"work_id":"fdaf53ad-50ee-42f8-82e6-e6406e78e078","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.402570Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:bf02a3f1af214e163da360d30e9f12b943ee80f43c8f5a2c5d644df022e853a7","observation_id":"043d9979-41bb-4e62-8ef3-754470da660e","resolution":{"observed_at":"2026-08-10T22:21:01.517837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.467530Z","title":"Hardware accel- eration of large scale gcn inference","venue":null,"work_id":"15ea97f3-dae7-4eb1-b098-875b6c103f1d","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.412065Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:6066f297cf5ea4d9a8e1a5cbe6387494e975b61cda9ae1b69adbeacf0c63827b","observation_id":"f71bf75c-46be-4796-9987-846e59d84a8e","resolution":{"observed_at":"2026-08-10T22:21:01.480358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.407132Z","title":"Autosync: Learning to synchronize for data-parallel distributed deep learning","venue":null,"work_id":"0be8dc7c-f7c9-473e-8fea-5cbfeed3f65b","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.421597Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:b51779736793f2343c14cab994a26769fa80a88cc9760d3fc333bc3ea4870851","observation_id":"d8bdd40a-449d-4617-b1fa-407f42a8deb7","resolution":{"observed_at":"2026-08-10T22:21:01.414892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.372997Z","title":"Understanding gnn computational graph: A coordinated computation, io, and memory perspective","venue":null,"work_id":"aefe31c6-fbc4-45f6-96dc-0257aa43243b","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.428702Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:0e867a84ce9c4295d5d3fd4cffb8946f20ebed40d54e4bf897983f202767bfab","observation_id":"226251fb-c1b5-4d19-af6c-c9f5c1cb842f","resolution":{"observed_at":"2026-08-10T22:21:01.380663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.325187Z","title":"Sylvie: 3d-adaptive and universal system for large-scale graph neural network training","venue":null,"work_id":"d1d0b5d9-14d5-46fa-bb86-d2d18e7c7acb","year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.444800Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:cd02fec1d06eec019fb3bdcb1bcc278412d4c1978398ccb935c085c98e40380c","observation_id":"eef5f213-4459-43c6-8fcf-05e22b254284","resolution":{"observed_at":"2026-08-10T22:21:01.337455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:59.466573Z","title":"A survey on graph neural network acceleration: Algorithms, systems, and customized hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.466573Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:544697987a8872e12c7efae8e1519e5c21363b4479efe3ff0229df7b03b3e8ba","observation_id":"074e3a38-5b1f-415a-87f7-6211cd42e502","resolution":{"observed_at":"2026-08-10T22:20:59.466573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.290164Z","title":"G-cos: Gnn-accelerator co-search towards both better accuracy and efficiency","venue":null,"work_id":"7509e22b-23b3-4da2-a286-7fc69a917fac","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.474260Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:7a7180c1536c982ea60a758d2f685d6e84bd87ef7cfd846ad7916fb4882a7f71","observation_id":"0017fa5e-48dd-41b9-893c-814409a72f4b","resolution":{"observed_at":"2026-08-10T22:21:01.295822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T22:20:59.490966Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.490966Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:12ed2742e6774fb1c47c8135e931e5922affb41e0df7a086b02934be97222881","observation_id":"354e0a3f-1189-409a-8e77-fc09bf6937e8","resolution":{"observed_at":"2026-08-10T22:20:59.490966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.263377Z","title":"Distdgl: dis- tributed graph neural network training for billion-scale graphs","venue":null,"work_id":"a8753e15-d963-4c35-aa7e-8ef2417032ab","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.498436Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:238177a4f8abc409b109a29a62200127a48c227c5967daadfd671867cabd8d4b","observation_id":"cfbc0ac6-f3d0-4db7-bab7-145e04795291","resolution":{"observed_at":"2026-08-10T22:21:01.278205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12023","last_updated":"2022-06-28T19:36:44Z","snapshot_observed_at":"2026-08-07T05:15:09.810779Z","submitted_at":"2022-01-28T10:13:35Z","title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12023","snapshot_observed_at":"2026-08-10T22:20:59.515950Z","title":"Alpa: Automating inter-and intra- operator parallelism for distributed deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.515950Z"},"links":{"cited_paper":"/paper/2201.12023","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:62c57a966ce811831c812042a1bb90f801ab0f893c9bb5de65e3b50d994373c2","observation_id":"29e2cab1-2fc9-4a87-ad2f-824e7f23e79e","resolution":{"observed_at":"2026-08-10T22:20:59.515950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08730","last_updated":"2019-02-23T03:45:31Z","snapshot_observed_at":"2026-07-06T07:34:54.202142Z","submitted_at":"2019-02-23T03:45:31Z","title":"AliGraph: A Comprehensive Graph Neural Network Platform","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08730","snapshot_observed_at":"2026-08-10T22:20:59.524307Z","title":"Aligraph: A comprehensive graph neural network platform","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.524307Z"},"links":{"cited_paper":"/paper/1902.08730","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:357c62e07fe6384b7b2893bfca4fb29667cc258d58dc1cdb225e90be8371d660","observation_id":"4e0e9db2-931a-4e59-b5a0-117a1f9dcac7","resolution":{"observed_at":"2026-08-10T22:20:59.524307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T16:13:21.974932Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":7,"verified_fuzzy":48},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2501.01951."}