{"as_of":"2026-08-07T14:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edc64027c2e3d9150b78266626c4e5eaf4520d7b3e6b77d0d0b82a859c0c5967","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:50.830441Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:59:45.779352Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-08-07T11:20:50.830441Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02787","last_updated":"2025-06-03T12:14:17Z","snapshot_observed_at":"2026-08-07T11:13:48.914925Z","submitted_at":"2025-06-03T12:14:17Z","title":"Rethinking Dynamic Networks and Heterogeneous Computing with Automatic Parallelization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:50.830441Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2506.02787"},"observation_digest":"sha256:d3ea5ab2cd10e180e40d8ef34edfdce508224009a0324f031b4cf0b981e79683","observation_id":"212b88bf-4fd2-44cb-aa25-822f9488130a","resolution":{"observed_at":"2026-08-07T11:20:50.830441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-08-04T14:43:01.294927Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23722","last_updated":"2026-07-03T02:44:15Z","snapshot_observed_at":"2026-08-04T14:42:54.705316Z","submitted_at":"2025-09-28T08:05:13Z","title":"OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T14:43:01.294927Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2509.23722"},"observation_digest":"sha256:956ed9fc8f953a1a075ba2b65ecbf5b29d04ff91ba6b57cba78c7c8a94d7047a","observation_id":"e9187a99-8bee-4347-a13b-3a75ff5a9d5f","resolution":{"observed_at":"2026-08-04T14:43:01.294927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2604.07144","last_updated":"2026-04-08T14:37:17Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:37:17Z","title":"Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:40.021376Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2604.07144"},"observation_digest":"sha256:d3e6f122859e020ba28eb568c9ab9c49ab436f50bb347fe9c8993e646f6d1d26","observation_id":"375f4a72-ba38-414c-bf02-ea84228555c2","resolution":{"observed_at":"2026-05-11T06:41:17.615643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2604.19654","last_updated":"2026-04-21T16:43:59Z","snapshot_observed_at":"2026-08-03T10:54:05.806041Z","submitted_at":"2026-04-21T16:43:59Z","title":"FEPLB: Exploiting Copy Engines for Nearly Free MoE Load Balancing in Distributed Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:14:18.241481Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2604.19654"},"observation_digest":"sha256:e0fb17e85089cd10380c4c165e3650c31b3c781ee706a10cd478c3c2e31542b1","observation_id":"451ccf74-a7d9-4dc7-8c1a-2fb58b37f9cd","resolution":{"observed_at":"2026-05-11T13:41:05.466156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.07569","last_updated":"2026-05-08T10:41:04Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:41:04Z","title":"HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T03:00:19.355357Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.07569"},"observation_digest":"sha256:e47bc6e0476dbe8b66a370754bd2da441db4d3bd275c94c6fa2c8ecfca49b2db","observation_id":"880bfd4e-5e4c-492d-9bc2-d338a3384700","resolution":{"observed_at":"2026-05-11T03:00:55.678755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.16637","last_updated":"2026-05-15T21:09:34Z","snapshot_observed_at":"2026-07-06T23:27:43.762904Z","submitted_at":"2026-05-15T21:09:34Z","title":"HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T20:58:51.630574Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.16637"},"observation_digest":"sha256:6261f4526480b4fa0e5956c7b6a43577aea33ddd4ce44d9dd02953de2cd08b00","observation_id":"28976e67-9f84-4676-83dd-e844bb66414c","resolution":{"observed_at":"2026-05-19T21:02:47.406324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.21312","last_updated":"2026-05-20T15:40:18Z","snapshot_observed_at":"2026-08-02T01:15:29.579250Z","submitted_at":"2026-05-20T15:40:18Z","title":"Frontier: Towards Comprehensive and Accurate LLM Inference Simulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T03:47:49.835773Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.21312"},"observation_digest":"sha256:9b0565563eb6dc211733c7c329da6fdc018ccf8a71963408421b4424060aa9af","observation_id":"dcba0c51-3c7b-4f04-b769-4e61ac8c383e","resolution":{"observed_at":"2026-05-21T03:49:31.073602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.22014","last_updated":"2026-05-21T05:21:51Z","snapshot_observed_at":"2026-08-02T22:09:19.297160Z","submitted_at":"2026-05-21T05:21:51Z","title":"LiveR: Fine-Grained Elasticity via Live Reconfiguration for Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T04:26:56.343905Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.22014"},"observation_digest":"sha256:1ec5123c7038081c31218eed656f54d5a0969c4eaf796a04ff8844009d1f2926","observation_id":"e2b278f7-2bcf-4a6f-a5c0-f22e8ad4e498","resolution":{"observed_at":"2026-05-22T04:31:03.955731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2606.11169","last_updated":"2026-06-09T17:48:41Z","snapshot_observed_at":"2026-08-03T00:36:26.241446Z","submitted_at":"2026-06-09T17:48:41Z","title":"Piper: A Programmable Distributed Training System","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:34:02.562929Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2606.11169"},"observation_digest":"sha256:b1911329d3bec4e81341efd9b2cf68aae56442486356470809a41a9427d0456a","observation_id":"9a730153-3192-4064-8f26-bf1ccfa68fc1","resolution":{"observed_at":"2026-07-03T07:57:44.637394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2606.23087","last_updated":"2026-06-22T09:33:44Z","snapshot_observed_at":"2026-08-07T03:19:48.834246Z","submitted_at":"2026-06-22T09:33:44Z","title":"FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T09:13:19.671985Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2606.23087"},"observation_digest":"sha256:1845a63a1aecdcf2ddc7a276613c1b2adf1ac0b11176b964c559c65e789e77b0","observation_id":"5a3df194-1fbb-4f69-8da9-8454a94bfb9b","resolution":{"observed_at":"2026-07-04T09:59:45.780630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2211.13878/citation-record","integrity":"/paper/2211.13878/integrity","json":"/paper/2211.13878/citation-record.json","paper":"/paper/2211.13878"},"outbound":[],"paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T14:22:52.265358Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2211.13878."}