{"as_of":"2026-08-14T07:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4715be1aec0a69e57f2407247e021e422d1d1c42fd0418c08ef1b1593c6644d6","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:59:59.178147Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:14:18.241481Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:41:05.332612Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.00254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d1caedcc-84b9-4f07-ab3e-b0499b066d15","year":2024},"citing_paper":{"arxiv_id":"2604.19654","last_updated":"2026-04-21T16:43:59Z","snapshot_observed_at":"2026-08-03T10:54:05.806041Z","submitted_at":"2026-04-21T16:43:59Z","title":"FEPLB: Exploiting Copy Engines for Nearly Free MoE Load Balancing in Distributed Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:14:18.241481Z"},"links":{"cited_paper":"/paper/2501.00254","citing_paper":"/paper/2604.19654"},"observation_digest":"sha256:718cb92da0af7427d6df9dc7eb369195e2bd4ddf33698d461e096c630186fa8c","observation_id":"70435530-ecf5-457d-a06b-f68f0dd663fc","resolution":{"observed_at":"2026-05-11T13:41:05.334784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00254/citation-record","integrity":"/paper/2501.00254/integrity","json":"/paper/2501.00254/citation-record.json","paper":"/paper/2501.00254"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.064420Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.064420Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:dcc51f0c3d67b6b41eea71f6a5e78f0c1bf06f807cb7f4a214575650a45e6b84","observation_id":"0a4ca7bd-69f2-449d-80bf-e397158472d5","resolution":{"observed_at":"2026-08-10T22:59:59.064420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.069210Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.069210Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:eb343b8677b3cb188019b2c928402c24b4c7e7ea6618a5d510cdc69cf5d5b230","observation_id":"e1cd7783-c833-41db-997b-9ea2e48d0093","resolution":{"observed_at":"2026-08-10T22:59:59.069210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.527271Z","title":null,"venue":null,"work_id":"3e6fc6d8-1a11-4aeb-8e4c-8e53227a1a6b","year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.074213Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:e0ecd4f02475b2ac79810b1f96b050e8c89d80ed5e48e1c146c1744b3ca7c8ff","observation_id":"ec535dd2-75b7-4bd4-88fb-da89b5811586","resolution":{"observed_at":"2026-08-10T22:59:59.531078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.515477Z","title":null,"venue":null,"work_id":"89ae8ef6-e31f-4907-9aad-fe0af683c21b","year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.079200Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:bd114e605d7e047b821b2d50c57bc26ce70c30725f4014306c2e8b8e7161bf84","observation_id":"5e9236c3-5c72-4c3e-b8d8-e3ee622202f7","resolution":{"observed_at":"2026-08-10T22:59:59.519678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T22:59:59.083419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.083419Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:77c6d22e6c9921a72b0fcd2b1156fb1bbbcb51047177b2afe82cd3c89418348d","observation_id":"2ba72cbb-9818-4249-907e-b88349f2a86d","resolution":{"observed_at":"2026-08-10T22:59:59.083419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09149","last_updated":"2024-01-22T06:40:44Z","snapshot_observed_at":"2026-08-13T04:40:41.857015Z","submitted_at":"2024-01-17T11:47:59Z","title":"InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09149","snapshot_observed_at":"2026-08-10T22:59:59.087684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.087684Z"},"links":{"cited_paper":"/paper/2401.09149","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:9d29f29f477d3852e62fbf00875a69a307b40a0d896e7eeda81c2c6454053ef2","observation_id":"e3d21145-a208-4817-9d02-ecc69d364c03","resolution":{"observed_at":"2026-08-10T22:59:59.087684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.500978Z","title":null,"venue":null,"work_id":"4a725f59-4791-4894-97ff-adc144f58e11","year":2012},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.091999Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:595105095ce6770234a9d17fa2a033f7ee2c0f7b7f03daf35c221fda26a0fd5a","observation_id":"00da802b-3eed-4344-9a25-3cd2b544bb04","resolution":{"observed_at":"2026-08-10T22:59:59.505388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T22:59:59.095831Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.095831Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:bd57fc1dcd88db33f21136862092976c6d1b7e1b227764cd5f19f2b253328606","observation_id":"8c4e5376-084a-4c39-b74e-d757f39084cf","resolution":{"observed_at":"2026-08-10T22:59:59.095831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.487466Z","title":"V.; Wu, Y.; et al","venue":null,"work_id":"d74ea19d-897d-4733-ba90-dafdfe40afea","year":2019},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.100186Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:7128f21937ebd1c24782325c52def05a42884a8d781d6574a5a732e3cfea9d20","observation_id":"41d8cddd-8c54-4ea3-a8bb-96fe8b3d46a1","resolution":{"observed_at":"2026-08-10T22:59:59.492312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.475130Z","title":null,"venue":null,"work_id":"9f8ac96a-2d48-42c2-b59c-decf5f731984","year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.103756Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:e9db078542f36af82bdc010712f9b2f5a1c3df8c6ff34bee42b3980d9c1cfb8d","observation_id":"a024b9ed-d512-4e17-ae5a-53c44344860e","resolution":{"observed_at":"2026-08-10T22:59:59.479479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.463198Z","title":null,"venue":null,"work_id":"ce4abfd2-da2f-408b-9bc4-3d813a524d7e","year":2019},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.107648Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:6701cf3473107391d5b9e58dd629591672d135cf645752b8a0f390cc91677bd6","observation_id":"e19cbe07-c47c-402e-b34d-92edabb8cd62","resolution":{"observed_at":"2026-08-10T22:59:59.467316Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T22:59:59.111758Z","title":"B.; Chess, B.; Child, R.; Gray, S.; Radford, A.; Wu, J.; and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.111758Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:be26815ce21659cd57a47df5aa882a8e189f59a5a5fac198ab2471dce6b35cfe","observation_id":"4a19eb2f-5ea7-4b6e-93a2-ac32ba6b1068","resolution":{"observed_at":"2026-08-10T22:59:59.111758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10465","last_updated":"2021-09-22T00:57:46Z","snapshot_observed_at":"2026-08-13T18:07:35.055898Z","submitted_at":"2021-09-22T00:57:46Z","title":"Scalable and Efficient MoE Training for Multitask Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10465","snapshot_observed_at":"2026-08-10T22:59:59.116949Z","title":"J.; Awan, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.116949Z"},"links":{"cited_paper":"/paper/2109.10465","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:a05f198f0fc1b971e095f4f0361ee8e21922f835f1e75cf28f0b32880254c60a","observation_id":"70fd5a5a-ee33-4db2-a7e8-140b92bfc656","resolution":{"observed_at":"2026-08-10T22:59:59.116949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.451512Z","title":"A.; Casper, J.; Lym, S.; McAfee, L.; Andersch, M.; Shoeybi, M.; and Catanzaro, B","venue":null,"work_id":"9ac969fe-399a-4df5-bd7c-1a87e15817b5","year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.121192Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:243d041fa652a5f1bd567bf328fd4aa0cd20de582429196f46d331a66d9516a1","observation_id":"ca580d36-833d-4acf-b6f2-f4df59407a06","resolution":{"observed_at":"2026-08-10T22:59:59.455960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.440197Z","title":"G.; Park, J","venue":null,"work_id":"b5fed07b-1faa-4a95-9da9-042a76d0a69d","year":2014},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.125657Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:7220709c7bd589e841857bbdaeb74fbeb5a67bed11e85ddaf0d2d2965ba119a0","observation_id":"8d81d586-569c-4428-add5-432a8b67e78d","resolution":{"observed_at":"2026-08-10T22:59:59.443614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.429456Z","title":"G.; Smola, A","venue":null,"work_id":"2e09f6ee-7a79-41c2-8db0-289444a0d7d0","year":2014},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.129603Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:f880926327ed326d9ebde15fd30236b58b1b75713dc6bd7539fe7b4ce7ccbd85","observation_id":"0a47f1cd-248c-4a0c-b6b1-a0f66dd2f60b","resolution":{"observed_at":"2026-08-10T22:59:59.432815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-10T22:59:59.133758Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.133758Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:762d0847cb92c4983f4a497a89ba3d0f3f7b0dbcd09f7da04770362b6e27bd4e","observation_id":"253fd9db-d347-4c64-ad4f-2a0c238ffe64","resolution":{"observed_at":"2026-08-10T22:59:59.133758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.415278Z","title":null,"venue":null,"work_id":"274cde05-55d0-4a00-9084-de8748a112e6","year":2022},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.138257Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:45f5697aed7ada3b2032b5bd916dbe75734cbc9470fed16a69cae9292e0ab785","observation_id":"56487cc7-2d6a-43ca-bf81-3f706a88714f","resolution":{"observed_at":"2026-08-10T22:59:59.419919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.401800Z","title":null,"venue":null,"work_id":"9f489987-5b23-4dbd-9f4a-ea47090ebe2a","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.142064Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:186ee4fc906c0ffc73a4d8652c731624928780eedb780409f09944c2dbbc98f4","observation_id":"df52d0a5-e554-4b57-aa13-28474cd4e060","resolution":{"observed_at":"2026-08-10T22:59:59.406399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T22:59:59.146149Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.146149Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:d8f0fc8023793cf33665dd610ac79f27047cbeb3a070cab1c68b48de15fdf8a1","observation_id":"e815fc39-0ed3-46ec-a5df-920a95bf6b17","resolution":{"observed_at":"2026-08-10T22:59:59.146149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10241","last_updated":"2023-11-30T10:40:34Z","snapshot_observed_at":"2026-08-13T05:13:34.244145Z","submitted_at":"2023-11-30T10:40:34Z","title":"Zero Bubble Pipeline Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10241","snapshot_observed_at":"2026-08-10T22:59:59.150576Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.150576Z"},"links":{"cited_paper":"/paper/2401.10241","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:7cccd2161f9183390f1ca1e4f97133d7c9bd399c9206b69f2e168a32b9febe34","observation_id":"79d021ef-6ae1-44fe-8362-db3e968f3bbc","resolution":{"observed_at":"2026-08-10T22:59:59.150576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.387140Z","title":null,"venue":null,"work_id":"d57d0c24-c9de-45b7-85a1-92456e516c38","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.155418Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:26ed3abd55511b4ce98b2baa66eb743eb065af7fe4d6df73b330d194dee7efe0","observation_id":"b06433d2-5fed-4dfa-b671-346cdf92fa9a","resolution":{"observed_at":"2026-08-10T22:59:59.391551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.372193Z","title":null,"venue":null,"work_id":"80912a40-94d4-4364-acbd-33c4c9c85f94","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.158802Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:c9c252d316fd374a957131eee4a1f8fc1bb0c7bfd2935b0a39005833c5447eaf","observation_id":"78f6b8bc-17d3-4e88-a119-54d0ad170fb8","resolution":{"observed_at":"2026-08-10T22:59:59.376801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.359325Z","title":null,"venue":null,"work_id":"ade62e9f-9214-4c38-9dda-5751c8855736","year":2020},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.161921Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:58145a00c84b5121f7292634f0ff72d9e589e3e5dff59a7f179255a35056406a","observation_id":"fb123771-5030-4810-939e-e2fc7fa8deb0","resolution":{"observed_at":"2026-08-10T22:59:59.363138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T22:59:59.164785Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.164785Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:eaba87e32db1c13ca9ec4657a1edc8a9d8050b8e10d976903079cec03ea49ede","observation_id":"f0e7a721-ec93-426c-8a0f-3d8db157732c","resolution":{"observed_at":"2026-08-10T22:59:59.164785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.347963Z","title":"S.; Maggioni, M.; Zhang, Q.; et al","venue":null,"work_id":"61ae6364-3440-458f-ab2d-ae0428544cb0","year":2022},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.168191Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:0169a851c251ee499eb8d19b37d9015ae8f371fcf2c6d4a277b048e9994a8435","observation_id":"ce86d84f-7806-4000-b5ca-4f18cf2d6484","resolution":{"observed_at":"2026-08-10T22:59:59.351884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T22:59:59.171724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.171724Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:756d50ce10628c720f04e7c7c70a2925c5688d1a5d4af87f80bd66fc5b6f772a","observation_id":"cbd6fbc5-5dac-4ef5-9e36-6d9b0c411356","resolution":{"observed_at":"2026-08-10T22:59:59.171724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.334337Z","title":null,"venue":null,"work_id":"4bbcf91d-915b-459e-80fa-3862b29d3480","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.175222Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:1048d33b1c5a71e9c3a0b6f9ad2daa8b996e1e6298a47d6bb31794b2ef83905a","observation_id":"48fe7f2c-14e8-4f04-bc82-56569f372f4e","resolution":{"observed_at":"2026-08-10T22:59:59.339475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07410","last_updated":"2024-08-14T09:34:19Z","snapshot_observed_at":"2026-08-12T23:03:50.741581Z","submitted_at":"2024-08-14T09:34:19Z","title":"Aquila2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07410","snapshot_observed_at":"2026-08-10T22:59:59.178147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.178147Z"},"links":{"cited_paper":"/paper/2408.07410","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:45887ea4f70bbe265eaa2ae482f8ef3f8d3b2fd04d93a1b3eb612066b36326c6","observation_id":"d72a9cd7-eb1a-47a8-827a-d9a9fcc4c144","resolution":{"observed_at":"2026-08-10T22:59:59.178147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T05:00:25.700786Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2501.00254."}