{"as_of":"2026-08-21T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f400fd885f0c5083b98c181338c4627642623cb20b3555f1484ac0038690fbad","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:28:53.094512Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.10480/citation-record","integrity":"/paper/2511.10480/integrity","json":"/paper/2511.10480/citation-record.json","paper":"/paper/2511.10480"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-03T22:28:41.660751Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:41.660751Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:1e40a1908c726775f313281106ad4dd69f60534ad4ffc99e317037fd39f000c2","observation_id":"975457dc-9204-4395-8c44-09011c4f3e12","resolution":{"observed_at":"2026-08-03T22:28:41.660751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:41.807702Z","title":"TensorFlow: Large-scale machine learning on heterogeneous systems,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:41.807702Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:36ac343e84b3572cb5fa6f3f8dc73b4d98e1bc201e53797a218c41a74ac03cd9","observation_id":"4dbe21a8-1c57-4cd2-aa4e-15f05310a67b","resolution":{"observed_at":"2026-08-03T22:28:41.807702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-03T22:28:41.969497Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:41.969497Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:4b936b2f33f88f9af20de49f5100ea6243a1ac3a14c45032c1d221810014c986","observation_id":"4685d74e-8012-4905-82e6-421da4e4cb8d","resolution":{"observed_at":"2026-08-03T22:28:41.969497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12391","last_updated":"2024-09-10T04:16:28Z","snapshot_observed_at":"2026-08-20T02:32:12.952166Z","submitted_at":"2023-11-27T13:35:15Z","title":"vTrain: A Simulation Framework for Evaluating Cost-effective and Compute-optimal Large Language Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12391","snapshot_observed_at":"2026-08-03T22:28:42.159543Z","title":"vtrain: A simula- tion framework for evaluating cost-effective and compute-optimal large language model training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.159543Z"},"links":{"cited_paper":"/paper/2312.12391","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:399f2e7b157520ee4d04d4a6bd5dde7763aa926e50abfee816a8118badf86a67","observation_id":"1c09dd53-1925-487e-8d25-1536867c40b0","resolution":{"observed_at":"2026-08-03T22:28:42.159543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:42.269986Z","title":"Deepbench: Benchmarking json document stores,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.269986Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:bbf0787b406870366ca34b660a4a107496caeb0f785fcc64e513bdaa3902f155","observation_id":"91831e5b-22c9-4ae3-aa54-05fe7fc4caab","resolution":{"observed_at":"2026-08-03T22:28:42.269986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:42.375989Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.375989Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:cf0767300ce22cb7f6b2f93f8aa2455be5dc7fde804008b42c5a16ed20f7bb4b","observation_id":"8f46ca54-e889-4b7d-a599-1d3922563172","resolution":{"observed_at":"2026-08-03T22:28:42.375989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:42.687244Z","title":"Aws trainium: The journey for designing and optimization full stack ml hardware,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.687244Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:ab89b06db8cb7588a277fdf81c4e2df20fc95a69b2cc094527a667d095943528","observation_id":"4ce579b1-4444-4512-bbe3-8bce9924f069","resolution":{"observed_at":"2026-08-03T22:28:42.687244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:42.730128Z","title":"CS-3 System,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.730128Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:2a9388e4fbd9e06dfe8073854f48463262724aaff4e0a35d6d605408728b66bf","observation_id":"7c622762-7e9b-449a-a10a-63a3677c3d9c","resolution":{"observed_at":"2026-08-03T22:28:42.730128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04799","last_updated":"2018-10-05T18:47:38Z","snapshot_observed_at":"2026-08-15T02:27:40.598046Z","submitted_at":"2018-02-12T20:49:34Z","title":"TVM: An Automated End-to-End Optimizing Compiler for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04799","snapshot_observed_at":"2026-08-03T22:28:42.872936Z","title":"Tvm: An automated end-to-end optimizing compiler for deep learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.872936Z"},"links":{"cited_paper":"/paper/1802.04799","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:c3b6ad54a761057f1be1cbc614d73ffe5779b8b72a0682d54e218c3ca49fd5e4","observation_id":"dcfca20f-d33d-4e93-839c-571db128b570","resolution":{"observed_at":"2026-08-03T22:28:42.872936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:42.962524Z","title":"Llmservingsim: A simulation infrastructure for llm inference serving systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.962524Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:5e9aad54587da662630eb7040b539d921ebb9dfeab1ad513fe148ad7bc14c33b","observation_id":"d018ef79-24e6-4a0c-bbc2-607818b6f872","resolution":{"observed_at":"2026-08-03T22:28:42.962524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-03T22:28:43.132459Z","title":"Palm: Scaling language modeling with pathways,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:43.132459Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:a69d58c4c8c94beff4cc577be6cb1d82db9d8b72f493afa457ab14bbce04c9b2","observation_id":"1c28aec7-d1cd-457a-96cb-29c4f3c56ea3","resolution":{"observed_at":"2026-08-03T22:28:43.132459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-03T22:28:43.248638Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:43.248638Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:736ee98a06ddbd7518d60091b2fa1ac8c8d464f2e2602d5507126e1ee308b20c","observation_id":"bd9c2cd4-b437-49d6-ba13-037fa9887cfe","resolution":{"observed_at":"2026-08-03T22:28:43.248638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:43.394715Z","title":"(2025, Feb.) Deepseek v3/r1 inference system overview","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:43.394715Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:6b9a00eadbbd7facc9881ef8cd3666b51be119dfeed6926a082e2b884584382b","observation_id":"df3c1376-69b5-4510-82b3-091366234152","resolution":{"observed_at":"2026-08-03T22:28:43.394715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:43.531964Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:43.531964Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:432153d3c0e9088c1bf54a742cb409306ab4f27f65262da243f374fcb7aa5ff9","observation_id":"588f51db-2474-4f7f-b5ab-1f37dfe726fa","resolution":{"observed_at":"2026-08-03T22:28:43.531964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:43.845345Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:43.845345Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:1cf71c2021a0e0b1775d8bebc5f7aade4a0f17aa96ab5093a3728daca64860fc","observation_id":"5dd8bbee-eb49-428c-a136-84bf4955be46","resolution":{"observed_at":"2026-08-03T22:28:43.845345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-03T22:28:44.177998Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.177998Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:06329f37119c13b0c82cdbed5a6d22eb21d0b63a61017fdbc65e043cd072e3d4","observation_id":"27d613b0-1a54-4ccf-b71d-6260a883f0bf","resolution":{"observed_at":"2026-08-03T22:28:44.177998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:44.343205Z","title":"Proteus: Simulating the performance of distributed dnn training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.343205Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:a5ebe2ddbc81d679191cca44e6078685df0a570ab2bf368ab58586e1802bc0ce","observation_id":"acea6a6b-8cf9-467d-baf1-0c69dd4f68a5","resolution":{"observed_at":"2026-08-03T22:28:44.343205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T22:28:44.027297Z","title":"Available: https://arxiv.org/abs/2412.19437","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.027297Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:67acb10df9098f98896adf13b05a3b597cbde366a3680585d41354cb41b424e1","observation_id":"1bfca747-4d4a-420a-a6c1-bf45f2052fce","resolution":{"observed_at":"2026-08-03T22:28:44.027297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-03T22:28:44.788506Z","title":"Zamba: A compact 7b ssm hybrid model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.788506Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:0b8f83ec09f28ab61a97f09c64084ab6a972e7088c026728fcac2668579d28f5","observation_id":"8a9f9172-58e4-4bf4-993f-7ea089a8ce94","resolution":{"observed_at":"2026-08-03T22:28:44.788506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:44.924351Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.924351Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:6290b03425463c529ce8a3997c1d4252690a00191afefa895700a6200246cfee","observation_id":"f20adffd-0b6e-4a3a-8efd-5b1eafa11e81","resolution":{"observed_at":"2026-08-03T22:28:44.924351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-03T22:28:45.186766Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.186766Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:93c4885441bce1665cd03c01eb0d1f0251cc13a0c11184dbf8611c37cb1f8859","observation_id":"d440f639-569a-4bca-bb08-2837deb82c85","resolution":{"observed_at":"2026-08-03T22:28:45.186766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-03T22:28:44.630274Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.630274Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:3562c606097df6b785453add162b7aca0f88654535a8507ba15fa80e9dec3bbc","observation_id":"b628937c-9f23-49d8-a535-a5de8a1ab5d7","resolution":{"observed_at":"2026-08-03T22:28:44.630274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-14T19:05:50.682260Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-03T22:28:45.455385Z","title":"Pipedream: Fast and efficient pipeline parallel dnn training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.455385Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:f395018154c6cbe00eaa7efbe6e2b9e1c3c75cbb8f514f2ead8bbffebb599441","observation_id":"597bdd83-b4f5-4542-b453-a181c5219d31","resolution":{"observed_at":"2026-08-03T22:28:45.455385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:45.661007Z","title":"Nemo: a toolkit for conversational ai and large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.661007Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:db248e1ce15b26e85fcaefb76c1ffa13b09b7000ea0f0a6673ab81afaef2d56f","observation_id":"2ea03c1f-082e-4227-997b-331b8a18e7a3","resolution":{"observed_at":"2026-08-03T22:28:45.661007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:45.747200Z","title":"Mad-max beyond single-node: Enabling large machine learning model acceleration on distributed systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.747200Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:9df134dc5fef3610de30fcd92bee81661efa7e10f02b201883fc355e3b133587","observation_id":"1995586a-bff3-4096-bdb1-e433488f776b","resolution":{"observed_at":"2026-08-03T22:28:45.747200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06965","last_updated":"2019-07-25T21:42:58Z","snapshot_observed_at":"2026-08-17T19:36:58.372516Z","submitted_at":"2018-11-16T18:43:28Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06965","snapshot_observed_at":"2026-08-03T22:28:45.817339Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.817339Z"},"links":{"cited_paper":"/paper/1811.06965","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:bfe12329f199ae79e05d812c2a7cb69d7cbb1c7e03fb50e5b9baa2ef4f480965","observation_id":"33dc3a51-316d-4298-a6ea-b47191ab994f","resolution":{"observed_at":"2026-08-03T22:28:45.817339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:45.319299Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.319299Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:6e59e99c3e80b5fab0b115f8ef129a3d1e2caf40a8af78fba7a23fba6866a0a8","observation_id":"509cecf6-35b6-4e51-8f1d-57286cd66ec1","resolution":{"observed_at":"2026-08-03T22:28:45.319299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.05358","last_updated":"2018-07-14T08:44:31Z","snapshot_observed_at":"2026-08-18T00:14:09.595998Z","submitted_at":"2018-07-14T08:44:31Z","title":"Beyond Data and Model Parallelism for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.05358","snapshot_observed_at":"2026-08-03T22:28:45.888108Z","title":"Beyond data and model parallelism for deep neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.888108Z"},"links":{"cited_paper":"/paper/1807.05358","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:a006cb380741db804be0fba02e2e5e08bdfff7975d5dcaae48ec4b00956f3560","observation_id":"148861d7-e07c-4ac9-a923-3e39bb41ce1b","resolution":{"observed_at":"2026-08-03T22:28:45.888108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-03T22:28:45.982859Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.982859Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:ea6e752a060e58f98e07747e23d073072e37e82f312429b6fd38facad187754a","observation_id":"2bf79a5f-d122-4ff9-9dfd-3ff57231abfe","resolution":{"observed_at":"2026-08-03T22:28:45.982859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-03T22:28:46.081239Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.081239Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:ea022246f467c1fed42b7f5d963e21279befa177f6fa94c561d52beb9397d433","observation_id":"920d2d2d-0e83-4006-8cfb-3f816f80bab7","resolution":{"observed_at":"2026-08-03T22:28:46.081239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-03T22:28:46.210013Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.210013Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:e5a386246b2118a10b36428aceafdba3058f60f79e2933b57c089f36922fc297","observation_id":"9e87420b-6699-49ff-bb70-79296f00c0b8","resolution":{"observed_at":"2026-08-03T22:28:46.210013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:45.846076Z","title":"Calculon: a methodology and tool for high-level co-design of systems and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.846076Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:86ef3feae471ad473000424174c863952c3da8454712a73593cffece325792c8","observation_id":"fd72bef0-284a-454e-8a79-5622d3faec4a","resolution":{"observed_at":"2026-08-03T22:28:45.846076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-03T22:28:46.495650Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.495650Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:16c2d53529146e4e3c180100cb5ee506f908616d359afdb02f563eea8b67b7d8","observation_id":"1b851992-037f-4081-adcb-bca6e9a8c962","resolution":{"observed_at":"2026-08-03T22:28:46.495650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-08-17T18:55:29.627886Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-03T22:28:46.685890Z","title":"Pytorch distributed: Experiences on accelerating data parallel training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.685890Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:4f2e749551bcd1aee016dd5e70f0cce6b7c0a9e002ad81034428257031558db0","observation_id":"a7871445-2772-4709-8485-403bbfa86d0f","resolution":{"observed_at":"2026-08-03T22:28:46.685890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04122","last_updated":"2023-04-11T18:16:38Z","snapshot_observed_at":"2026-08-16T16:08:03.448961Z","submitted_at":"2022-12-16T18:46:37Z","title":"Mystique: Enabling Accurate and Scalable Generation of Production AI Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04122","snapshot_observed_at":"2026-08-03T22:28:46.864181Z","title":"Mystique: Enabling accurate and scalable generation of production ai benchmarks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.864181Z"},"links":{"cited_paper":"/paper/2301.04122","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:9f11b1d580a4c8c0805e18987ac7d37d61dfac2b6c847b4cbd32e79a450ac7d6","observation_id":"d9dcb9c4-fb02-40d8-be20-077952eadb37","resolution":{"observed_at":"2026-08-03T22:28:46.864181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09307","last_updated":"2025-04-12T18:43:24Z","snapshot_observed_at":"2026-08-18T13:01:47.990321Z","submitted_at":"2025-04-12T18:43:24Z","title":"Lumos: Efficient Performance Modeling and Estimation for Large-scale LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09307","snapshot_observed_at":"2026-08-03T22:28:47.034412Z","title":"Lumos: Efficient performance modeling and estimation for large-scale llm training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:47.034412Z"},"links":{"cited_paper":"/paper/2504.09307","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:d44ae46824eb229c3aaaed467bbfa8c252a46c5da5bfadf15f561fffe11f7229","observation_id":"e0f732da-6b9c-439c-b604-9f115791c3ea","resolution":{"observed_at":"2026-08-03T22:28:47.034412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-08-20T12:46:28.852060Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-03T22:28:46.339471Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.339471Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:c91098f878b24404e287dc9ab2eb8cdce13afe5efd1f077337ecd04529a16a32","observation_id":"e0fd7fba-7f23-4a1d-9063-d8b7f7787471","resolution":{"observed_at":"2026-08-03T22:28:46.339471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:47.460469Z","title":"(2025, Apr.) The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:47.460469Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:7d1a4f60b0feb53c09879c1956f50cf265459df90a2d3996a572392163aa3079","observation_id":"e5afdbfc-fafb-4c09-aa18-866e4df4258b","resolution":{"observed_at":"2026-08-03T22:28:47.460469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:47.649467Z","title":"Chakra working group,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:47.649467Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:ee9d3371c5304f1f254cc17df30226615cc6a860cbe8a603c867a353b0627c27","observation_id":"8651109d-a51f-4dac-bbf7-35ac7d2ec61c","resolution":{"observed_at":"2026-08-03T22:28:47.649467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:47.824178Z","title":"Chakra schema,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:47.824178Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:392fcae8a39e3ec99b2252ba1479ee936e2edd59fb7e1f64b954d2dc72a6537f","observation_id":"096a128b-f444-45e8-9285-8951478e63ad","resolution":{"observed_at":"2026-08-03T22:28:47.824178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19580","last_updated":"2025-05-28T01:08:37Z","snapshot_observed_at":"2026-08-18T04:34:53.741594Z","submitted_at":"2024-07-28T20:39:16Z","title":"Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19580","snapshot_observed_at":"2026-08-03T22:28:48.025018Z","title":"Mini- batch coresets for memory-efficient training of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.025018Z"},"links":{"cited_paper":"/paper/2407.19580","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:7553f9fa36342f2fa0276f701a159ad2c6d542d60bb3fa3f3990b6dd68896831","observation_id":"a8c20ec4-ccf4-47d3-8a17-dc54f6c81886","resolution":{"observed_at":"2026-08-03T22:28:48.025018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:47.180588Z","title":"Jamba: A hybrid transformer-mamba language model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:47.180588Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:16c792563cd90526c96bdbb2e9f46367fbf4ae8fce113f950225f2234d260633","observation_id":"69c51205-91da-44f1-a197-3a07fa2541cd","resolution":{"observed_at":"2026-08-03T22:28:47.180588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-03T22:28:47.316725Z","title":"Available: https://arxiv.org/abs/2403.19887","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:47.316725Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:84c55f1110fbfecdd62da0d2d4732bfdcdf3d368551325838457c555b3173ebd","observation_id":"780b49ae-9675-4bf1-91b0-07024ac78175","resolution":{"observed_at":"2026-08-03T22:28:47.316725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:48.527721Z","title":"Nvidia nemo - open-source toolkit for conversational ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.527721Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:749b5888d14fe721fb03a301bded5120aa104b32e5155e4722b3739caf0e1cdf","observation_id":"bea1c8f9-4b95-4c5d-836c-5166650091f5","resolution":{"observed_at":"2026-08-03T22:28:48.527721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:48.637701Z","title":"Cuda profiling tools interface (cupti),","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.637701Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:bd2829003e40aa446198853bc109a47978b0ba3b4a8a851886db187457df1227","observation_id":"a839e268-7aa5-4d31-913f-2a878dd3f35e","resolution":{"observed_at":"2026-08-03T22:28:48.637701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:48.752847Z","title":"NVIDIA HGX Platform,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.752847Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:fc2f9a1671ea22a002c0a9fe5075a1986e355723e9b02148624ac07d0fe05fcb","observation_id":"41ec3c05-b888-4027-a103-2d46a92adc7a","resolution":{"observed_at":"2026-08-03T22:28:48.752847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:48.897383Z","title":"Tensor-train decomposition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.897383Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:c797312a74bac68fb708b6ae6c6e5182216d22ee5f98c194b81ecd04f580a535","observation_id":"74f5e107-7883-4aac-b9a2-8a73c8fc40f7","resolution":{"observed_at":"2026-08-03T22:28:48.897383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:48.191347Z","title":"Dnnfusion: accelerating deep neural networks execution with advanced operator fusion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.191347Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:a1d16a3e516750789dfc98ce701875f4301b394af9a8c6c332b21b78497ed49f","observation_id":"245ae9c8-b30f-4921-8ad0-447f32375204","resolution":{"observed_at":"2026-08-03T22:28:48.191347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:48.411513Z","title":"Nvidia cupti - cuda profiling tools interface,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.411513Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:1b222096120912d4beb5f9c6a98eb2970d6884d6497a868e1fb17898af4296fb","observation_id":"51e92297-962e-4f9a-8c97-4f75e4bada93","resolution":{"observed_at":"2026-08-03T22:28:48.411513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:49.260025Z","title":"Kineto: Performance profiling library for pytorch,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.260025Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:efa84945f2a1efe2b13a49ec1ef733049266b3a164718f8e803053a9da1649d2","observation_id":"d3d97571-ab5f-4562-b65c-37dcdd6e105a","resolution":{"observed_at":"2026-08-03T22:28:49.260025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:49.309195Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.309195Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:99328cc1809b6c00df1622dff7bca78317f9225c32ad6c32fd196515dddf2512","observation_id":"05b2cf1c-92a2-4c13-a680-466266f89427","resolution":{"observed_at":"2026-08-03T22:28:49.309195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:49.416818Z","title":"Themis: A Network Bandwidth-Aware Collective Scheduling Policy for Distributed Training of DL Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.416818Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:95416b099f72f83bb97e7b6a795acb4b82ca657d7bcbea27762fcce09520c969","observation_id":"21a126c3-4918-4e70-9e6b-1a1408847406","resolution":{"observed_at":"2026-08-03T22:28:49.416818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02549","last_updated":"2020-05-09T23:40:20Z","snapshot_observed_at":"2026-08-20T12:11:35.220543Z","submitted_at":"2019-11-06T18:43:10Z","title":"MLPerf Inference Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02549","snapshot_observed_at":"2026-08-03T22:28:49.552675Z","title":"Mlperf inference benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.552675Z"},"links":{"cited_paper":"/paper/1911.02549","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:bceefc2cdffc0b7ee8943124ef02156ab2946c4a60454c2569b086db02bb54cd","observation_id":"ba07bf13-a314-4d7f-9994-65bb45681de4","resolution":{"observed_at":"2026-08-03T22:28:49.552675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-03T22:28:48.992724Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:48.992724Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:109b51ff7bc7c29757c2cd52ac7d453e5cfe8a6e0d0a0b6530347ab254ffd507","observation_id":"fd138f74-44de-41d6-850d-56291f13d05f","resolution":{"observed_at":"2026-08-03T22:28:48.992724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:49.072985Z","title":"Pytorch profiler recipe,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.072985Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:80db0c1dbcbc5b5d9ba81b404ec3dd9d0445385ed0a9b4e64af8cd6ac835a218","observation_id":"2a6bbf08-3e0d-4918-8482-0075ab44c359","resolution":{"observed_at":"2026-08-03T22:28:49.072985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-03T22:28:50.146206Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:50.146206Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:8edbb2968880ff60880c4360bbba51a3c650639b56dbe5130f5637903ecf6291","observation_id":"cbb5cb81-42bd-4148-99e2-5ede5054aa8b","resolution":{"observed_at":"2026-08-03T22:28:50.146206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14516","last_updated":"2023-05-26T16:22:27Z","snapshot_observed_at":"2026-08-16T15:30:27.489103Z","submitted_at":"2023-05-23T20:45:45Z","title":"Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14516","snapshot_observed_at":"2026-08-03T22:28:50.401493Z","title":"Chakra: Advancing performance benchmarking and co-design using standardized execution traces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:50.401493Z"},"links":{"cited_paper":"/paper/2305.14516","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:01efc80d37bc4d12eb1b27484744ba24cdfcbbbc3040adf27635efb815d36807","observation_id":"f67695b0-17db-4c65-bc77-47ce67c7d415","resolution":{"observed_at":"2026-08-03T22:28:50.401493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:50.630678Z","title":"Kineto: A cpu+gpu profiling library for pytorch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:50.630678Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:c88b097eaec744dc4ac49f1ca021733ae7420ae66d93fd67372a7a190eec114e","observation_id":"32fe6233-5bae-4ff6-a76d-e87c18403510","resolution":{"observed_at":"2026-08-03T22:28:50.630678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T22:28:50.811194Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:50.811194Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:94c10819e12a7e76cd1738e3a624a5e2a17e75dfe5639c5282968d8881cd4e3a","observation_id":"25df82cd-2db5-4265-9c35-88e469633bb3","resolution":{"observed_at":"2026-08-03T22:28:50.811194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08429","last_updated":"2022-03-04T19:30:09Z","snapshot_observed_at":"2026-08-16T17:34:18.511251Z","submitted_at":"2021-12-15T19:16:29Z","title":"Torch.fx: Practical Program Capture and Transformation for Deep Learning in Python","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08429","snapshot_observed_at":"2026-08-03T22:28:49.782131Z","title":"Torch.fx: Practical program capture and transformation for deep learning in python,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.782131Z"},"links":{"cited_paper":"/paper/2112.08429","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:b5dd75826bba7529ee75ca529454a60a6e02ad16c29a58b442a31769622c48b4","observation_id":"21066473-b826-4001-92c1-5f9368b10766","resolution":{"observed_at":"2026-08-03T22:28:49.782131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:49.985332Z","title":"Param: A trace abstraction for ml workloads,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:49.985332Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:1daa1d1de04760d98cdb3cdbc696b8697c7f6778d7b6f97a750f40f67afde67e","observation_id":"6e570a86-6369-4129-8e6d-95af4d59740e","resolution":{"observed_at":"2026-08-03T22:28:49.985332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-03T22:28:51.474773Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:51.474773Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:2515e3c4684b47f6fbfc066260ae08371e53a80a09f0ba6aebe61cd5ada2a197","observation_id":"8ebec193-2645-4c4a-9d1e-87c7a1cc4e90","resolution":{"observed_at":"2026-08-03T22:28:51.474773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:51.703779Z","title":"Rail- only: A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters ,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:51.703779Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:daa959a90b43eb4a700c25ec0ffe6d2ea645c0f2b837329bf162fc2da074c2c3","observation_id":"daca4979-14b1-4423-8e99-0e2be961d3d8","resolution":{"observed_at":"2026-08-03T22:28:51.703779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:51.838163Z","title":"SimAI: Unifying architecture design and performance tuning for Large-Scale large language model training with scalability and precision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:51.838163Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:231b7fae2a5543280764ecfab0371b5812408ccf65ca18e225156e27e5584ad5","observation_id":"45616d57-e8d2-47c2-80dd-7f98f4b6f87c","resolution":{"observed_at":"2026-08-03T22:28:51.838163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:50.919851Z","title":"Unity: Accelerating DNN training through joint optimization of algebraic transformations and parallelization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:50.919851Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:9c20eecfe058454ba109bce46383db369e8ea47b3ad4a6c68689447393ca2ff1","observation_id":"ca8970e6-4381-495f-ad4b-f38c7d29c898","resolution":{"observed_at":"2026-08-03T22:28:50.919851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04730","last_updated":"2018-06-29T00:16:36Z","snapshot_observed_at":"2026-08-14T19:46:17.506277Z","submitted_at":"2018-02-13T16:53:01Z","title":"Tensor Comprehensions: Framework-Agnostic High-Performance Machine Learning Abstractions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04730","snapshot_observed_at":"2026-08-03T22:28:51.038040Z","title":"Tensor comprehensions: Framework-agnostic high- performance machine learning abstractions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:51.038040Z"},"links":{"cited_paper":"/paper/1802.04730","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:e550f3eeabba320a269addda435a8c8c19a59ef7460132d99fda15b251ce9b85","observation_id":"fdc4641b-48bc-44c1-b0d0-0b97d0c6ad69","resolution":{"observed_at":"2026-08-03T22:28:51.038040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:52.278732Z","title":"Optimizing deep learning inference via global analysis and tensor expressions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.278732Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:826cacf595e8eeee8246689d4b9e091f76d08efec86e5fb526c00e7cf4af082d","observation_id":"371d7773-2f88-42d2-a8cc-4a386746c2a4","resolution":{"observed_at":"2026-08-03T22:28:52.278732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:52.434311Z","title":"Apollo: Automatic partition-based operator fusion through layer by layer optimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.434311Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:58b01eb67e6bf5bceef3d6b6c0c10c72ec2e4f914da3f74bbc0e09659d5687b9","observation_id":"9fd9ae50-10e1-4869-9208-d31885ccf81a","resolution":{"observed_at":"2026-08-03T22:28:52.434311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:52.652524Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.652524Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:f0cd217445c01fc19dd5c19161f728191b5eb2c97a6fdad370d6b66767faa940","observation_id":"ed06e6ce-adea-4b82-ba80-193627ed2bb8","resolution":{"observed_at":"2026-08-03T22:28:52.652524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:52.986427Z","title":"Mist: Efficient distributed training of large language models via memory-parallelism co-optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.986427Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:3a6812c7fbd066d4e330cd50a71413fe17ef867a965b26547a29f29cf3adee46","observation_id":"18591ab9-35d7-4ae3-8332-e4e6ea72a238","resolution":{"observed_at":"2026-08-03T22:28:52.986427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:51.998167Z","title":"Astra-sim2. 0: Modeling hierarchical networks and disaggregated systems for large-model training at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:51.998167Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:831a813e862eb95ba9d02c15d5e8d4aee29292cda1265e78d018950f68c91b86","observation_id":"c2626767-9625-4c06-ad62-920b4b15d03c","resolution":{"observed_at":"2026-08-03T22:28:51.998167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14006","last_updated":"2023-03-24T14:00:18Z","snapshot_observed_at":"2026-08-18T14:25:23.386025Z","submitted_at":"2023-03-24T14:00:18Z","title":"ASTRA-sim2.0: Modeling Hierarchical Networks and Disaggregated Systems for Large-model Training at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14006","snapshot_observed_at":"2026-08-03T22:28:52.160288Z","title":"Astra-sim2.0: Modeling hierarchical networks and disaggregated systems for large-model training at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.160288Z"},"links":{"cited_paper":"/paper/2303.14006","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:819fb57aecbb5dfd0eeda5b0ac6cfb6d7341b081c38186c46b190a9c25f0c27a","observation_id":"f41e0e4f-7e01-40f6-beef-e81b4be8598b","resolution":{"observed_at":"2026-08-03T22:28:52.160288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:52.560125Z","title":"Available: https://proceedings.mlsys.org/paper files/paper/ 2022/file/e175e8a86d28d935be4f43719651f86d-Paper.pdf","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.560125Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:58606673ed565183bd952dbbb8c2b28688b6e36842a308971ad85a11a5b306a5","observation_id":"0f9e6831-0d99-4f11-a4b6-20ec5036afb3","resolution":{"observed_at":"2026-08-03T22:28:52.560125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-03T22:28:52.826267Z","title":"Available: https://arxiv.org/abs/2304.11277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:52.826267Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:677b2b4f42d7605bb3345308bd898fc47cbebaf1e085f0449790d2751759b194","observation_id":"8490d60b-4e3c-4736-b4a7-b5ef0a4d4939","resolution":{"observed_at":"2026-08-03T22:28:52.826267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:28:53.094512Z","title":"Resiliency at scale: Managing Google’s TPUv4 machine learning supercomputer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:53.094512Z"},"links":{"citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:ee7914b2b62a47f85f046f2935c38c77752b272e1aa876d2fe44aed7a057fb37","observation_id":"6cb18936-f7ea-4448-ba31-f839ae01e905","resolution":{"observed_at":"2026-08-03T22:28:53.094512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-03T22:28:42.600936Z","title":"Available: https://arxiv.org/abs/2005.14165","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:42.600936Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:be7bcad1178d17ad2b513826d2d965e821a8cbeb9bf61edff5a04466742afba6","observation_id":"143ceee9-fc1f-407e-b8cf-92e6eb6cc58e","resolution":{"observed_at":"2026-08-03T22:28:42.600936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02267","last_updated":"2023-06-04T05:47:32Z","snapshot_observed_at":"2026-08-19T03:08:01.282228Z","submitted_at":"2023-06-04T05:47:32Z","title":"Proteus: Simulating the Performance of Distributed DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02267","snapshot_observed_at":"2026-08-03T22:28:44.497499Z","title":"Available: https://arxiv.org/abs/2306.02267","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:44.497499Z"},"links":{"cited_paper":"/paper/2306.02267","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:cb7fa01d7dc74b84f58acf9529e76338aedd35187802c37eb8c68426f2e26d32","observation_id":"4a76995e-462c-4fc8-89a5-bc8001026a85","resolution":{"observed_at":"2026-08-03T22:28:44.497499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T22:28:45.063713Z","title":"Available: https://arxiv.org/abs/2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:45.063713Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:26a797da9a6fe3ec628cbd26192923aabab28d7d596278f07987007cfb43d980","observation_id":"574b2d60-6d92-4447-9477-26fce9eb75ff","resolution":{"observed_at":"2026-08-03T22:28:45.063713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T22:28:43.683960Z","title":"Available: https://arxiv.org/abs/2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:43.683960Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:410d6e7aed011dd60af1e4621b0e9166f6e72e2695cc80586f11ae1a7d0999ff","observation_id":"f585e8c7-3976-4155-a4a6-1e0e762bb0a2","resolution":{"observed_at":"2026-08-03T22:28:43.683960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","latest_version":3,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-17T21:36:04.478605Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":79,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2511.10480."}