{"as_of":"2026-08-10T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0be1b7980e983c9ca925777234d505d260e52e3c1ccc643d1af387a9e676a2e","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:52:30.795158Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00217/citation-record","integrity":"/paper/2509.00217/integrity","json":"/paper/2509.00217/citation-record.json","paper":"/paper/2509.00217"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07120","last_updated":"2025-07-07T19:47:24Z","snapshot_observed_at":"2026-08-06T19:23:55.037420Z","submitted_at":"2025-07-07T19:47:24Z","title":"Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07120","snapshot_observed_at":"2026-08-05T13:52:28.348753Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.348753Z"},"links":{"cited_paper":"/paper/2507.07120","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:1faa0ae42a1040d4b49db05168c38bc19baed48d0c32aabe759f1dc1a5c9ff48","observation_id":"24514ff3-c30a-4254-a4ec-ed5a690fdb0a","resolution":{"observed_at":"2026-08-05T13:52:28.348753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:33.020054Z","title":"Beyond data and model parallelism for deep neural networks","venue":null,"work_id":"5ba66983-5cf2-456d-80cf-602f36483974","year":2019},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.503168Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:2d277ecfccd5312abf7c46cc3fab812400371d5235adaba28199adce6818ec7e","observation_id":"6a79779b-d657-4fdc-a734-2e37e0500b3e","resolution":{"observed_at":"2026-08-05T13:52:33.107795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16432","last_updated":"2024-12-21T01:37:59Z","snapshot_observed_at":"2026-08-10T03:05:49.725816Z","submitted_at":"2024-12-21T01:37:59Z","title":"DFModel: Design Space Optimization of Large-Scale Systems Exploiting Dataflow Mappings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16432","snapshot_observed_at":"2026-08-05T13:52:28.621920Z","title":"Dfmodel: Design space optimization of large-scale systems exploiting dataflow mappings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.621920Z"},"links":{"cited_paper":"/paper/2412.16432","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:67a7774dfc76caae2e9e423c9bbef8e2f76aa3d94b858ad4774cf4255d262c06","observation_id":"40a14d2e-66cf-4780-9500-d1b0f6765978","resolution":{"observed_at":"2026-08-05T13:52:28.621920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T13:52:28.794986Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.794986Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:e0ac814f6963fbaa9b9300b3afc768068ab42c7cedf9bc2fad59e4681386b7ad","observation_id":"5b76fa2b-c631-4d1f-91e3-164d2e7593a7","resolution":{"observed_at":"2026-08-05T13:52:28.794986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:32.802604Z","title":"Uniap: Unifying inter-and intra-layer automatic parallelism by mixed integer quadratic programming","venue":null,"work_id":"1ecb7114-cb32-495d-96e8-06d63c07bfeb","year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.980821Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:7d2ef8d231e218f42eb2d8b55b2627a4d1247a65b31191647bee7a9bb47de2a0","observation_id":"a7f1be0c-89e7-48d9-b685-2dde9885f28f","resolution":{"observed_at":"2026-08-05T13:52:32.938616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T13:52:29.128897Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.128897Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:8c54ac6324d67c1e70ab948718a2ca55c5b5ccde4e0a9fbc6893160f73008658","observation_id":"7b101fe8-429b-4831-b6ba-58386779095b","resolution":{"observed_at":"2026-08-05T13:52:29.128897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:32.636989Z","title":"GTC 2024 Presentation Slides","venue":null,"work_id":"55b2cb0c-4db4-451b-9261-58c4136126cc","year":2024},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.248129Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:b2113baef91af022edaee3ba291b169e61d8ed66ec2c8af94d4aff5a569a6da0","observation_id":"1f5b5377-1a15-4f07-84e9-84a7601fa0a8","resolution":{"observed_at":"2026-08-05T13:52:32.719159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:32.442770Z","title":"XLA: A Machine Learning Compiler","venue":null,"work_id":"d231b916-13de-4549-bd89-6fecdcae14a7","year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.393837Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:59bfd93fdf07df7aa497e22e702ee7437ccf23810db5acafe5fd9633453f0bc7","observation_id":"2228811a-d1e5-4ec9-ba21-6477f006a408","resolution":{"observed_at":"2026-08-05T13:52:32.537233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:29.531030Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.531030Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:20241423f18775039a4970cdb782c688edec018461a7e8afca13c3083331c5bc","observation_id":"595358c9-665f-4332-8376-9a535c1632b6","resolution":{"observed_at":"2026-08-05T13:52:29.531030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:32.222896Z","title":"Chimera: Communication fusion for hybrid parallelism in large language models","venue":null,"work_id":"7d47b172-a3ef-4446-897a-1e72f2bce15c","year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.660202Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:74d6b5b8c2be12eb74212f18b368023a030cfee75a7e74a0b5da2e33475f0da5","observation_id":"b95ac045-07ad-4f81-933b-504736ffec3a","resolution":{"observed_at":"2026-08-05T13:52:32.324083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:31.992478Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":"17b1f73b-312b-4804-b76f-0a2e8af88bce","year":2021},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.769958Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:d8cc6c2c215d2b87fe05b182d23ef1041cfea70a74f842c51c2369010affafae","observation_id":"8807b12b-2a57-4ff6-86fc-7823c750932f","resolution":{"observed_at":"2026-08-05T13:52:32.123443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15020","last_updated":"2025-05-21T01:57:22Z","snapshot_observed_at":"2026-08-07T15:23:13.934927Z","submitted_at":"2025-05-21T01:57:22Z","title":"COSMIC: Enabling Full-Stack Co-Design and Optimization of Distributed Machine Learning Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15020","snapshot_observed_at":"2026-08-05T13:52:29.883265Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.883265Z"},"links":{"cited_paper":"/paper/2505.15020","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:76edb52b8fd988c7a8c9e3d382c90115c6e1a1350075f5efec8154f64d559702","observation_id":"f477b404-937b-412b-9dc5-083a2c8a6dc7","resolution":{"observed_at":"2026-08-05T13:52:29.883265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00247","last_updated":"2025-08-05T04:55:48Z","snapshot_observed_at":"2026-08-08T23:53:40.484254Z","submitted_at":"2023-02-01T05:22:28Z","title":"TAPAS: Fast and Automatic Derivation of Tensor Parallel Strategies for Large Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00247","snapshot_observed_at":"2026-08-05T13:52:29.961252Z","title":"TAPAS : Fast and automatic derivation of tensor parallel strategies for large neural networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:29.961252Z"},"links":{"cited_paper":"/paper/2302.00247","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:30d949d87c9fd89abf88ba25e8bbb5bb2c65c5d024bc815e6b93fe8ce8aadf1a","observation_id":"8c328cf8-f322-402f-ac26-24a7ec6b5976","resolution":{"observed_at":"2026-08-05T13:52:29.961252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:31.826812Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":"3ae72f06-eed5-4194-8b0e-d1cb910587de","year":2019},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.105334Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:9070b625d03b48106f59b5aeeb8c718eded870cb71ead9ddadb649ef8fb14385","observation_id":"ad31324f-7da3-4822-8c0c-b32818347c4b","resolution":{"observed_at":"2026-08-05T13:52:31.925984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06433","last_updated":"2025-03-09T04:14:06Z","snapshot_observed_at":"2026-08-07T17:19:30.916136Z","submitted_at":"2025-03-09T04:14:06Z","title":"Seesaw: High-throughput LLM Inference via Model Re-sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06433","snapshot_observed_at":"2026-08-05T13:52:30.186309Z","title":"Seesaw: High-throughput llm inference via model re-sharding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.186309Z"},"links":{"cited_paper":"/paper/2503.06433","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:53159ea24a763a7758c76b52e80bb29afc5a4bfb9caf21d850e3ff3b4689b83a","observation_id":"f90f5743-a83d-4467-9673-c90090343477","resolution":{"observed_at":"2026-08-05T13:52:30.186309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T13:52:30.295978Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.295978Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:c8a6ee885b3e8857dee6b96b1cbaedf3aadd4db978b7520cde982ad1015c129e","observation_id":"71fae5b5-2e42-40e4-ba1c-1b99cd58f76c","resolution":{"observed_at":"2026-08-05T13:52:30.295978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:31.625563Z","title":"Gspmd: General and scalable parallelization for ml computation graphs","venue":null,"work_id":"c24ad741-6655-4e6f-af76-61db6ca34d2c","year":2021},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.383478Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:97b02ca2c5b3bf8dcec90fff3c8c2d32762c800ed23b0719a90d562cd235f261","observation_id":"1f22e790-a78a-4de0-b34c-f9ac21ef6a9b","resolution":{"observed_at":"2026-08-05T13:52:31.726728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:31.424576Z","title":"E., and Stoica, I","venue":null,"work_id":"9045f5f1-92eb-4acc-91ac-8e1c4dc690d5","year":2023},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.482618Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:fc905bcb8aebf56d0283028210b57a58964aeaa55107bacd2ae1742742232db1","observation_id":"a7e2a1a5-b25a-4ed8-a26f-354291a9a81e","resolution":{"observed_at":"2026-08-05T13:52:31.519861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:31.182047Z","title":"E., Stoica, I., Jin, X., Xing, E., Chen, Q","venue":null,"work_id":"5c0309b3-fb87-4712-9e09-7a71f1d887ea","year":2022},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.596691Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:3e291e4bc4cea15ad691775612162636bf4167174542dac57093ea73a903e2c1","observation_id":"2db2af95-05f3-4256-babb-53c556d30641","resolution":{"observed_at":"2026-08-05T13:52:31.283647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:30.993887Z","title":"Transferable graph optimizers for ml compilers","venue":null,"work_id":"fb335c84-1f12-4900-a154-0343e3d81fac","year":2020},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.710769Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:26081f4fd038334d344a39a6b47446834193397538161d65491405fdf615f205","observation_id":"adf31cff-bb2c-4e4e-8fdd-62fbfd84edf5","resolution":{"observed_at":"2026-08-05T13:52:31.107411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:52:30.795158Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:30.795158Z"},"links":{"citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:7617b6770a5557f3f8404986920f28b62c7a759201dd731274fde6b629c2ff97","observation_id":"4cbc4e50-ff62-422c-bcf1-4b136548b95f","resolution":{"observed_at":"2026-08-05T13:52:30.795158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2509.00217."}