{"as_of":"2026-08-08T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0d7809935e79ffa3bc477af0326434decf9aae6fff6cde9cd4133461f4a5178","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:03:46.238908Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T12:16:10.904456Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T16:04:52.780559Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"cited_work":{"arxiv_id":"2507.21276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21276","snapshot_observed_at":"2026-06-30T16:04:52.780559Z","title":"Lemix: Unified scheduling for llm training and inference on multi-gpu systems","venue":null,"work_id":"a2719614-a54f-4c89-97da-7a3be4fe667a","year":2025},"citing_paper":{"arxiv_id":"2605.23027","last_updated":"2026-05-21T20:50:47Z","snapshot_observed_at":"2026-07-06T23:33:19.375527Z","submitted_at":"2026-05-21T20:50:47Z","title":"PIMbot: A Self-Adaptive Attack Framework for Adversarial Manipulation of Multi-Robot Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T05:26:22.623367Z"},"links":{"cited_paper":"/paper/2507.21276","citing_paper":"/paper/2605.23027"},"observation_digest":"sha256:2cc6bd8f30d0d374d05995b46ea75128fdd4090c9ed1251ea41e67ac0592ac10","observation_id":"e1558f60-c1c4-49c3-bcd2-4291f8735d08","resolution":{"observed_at":"2026-05-25T05:26:38.661743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"cited_work":{"arxiv_id":"2507.21276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21276","snapshot_observed_at":"2026-06-30T16:04:52.780559Z","title":"Lemix: Unified scheduling for llm training and inference on multi-gpu systems","venue":null,"work_id":"a2719614-a54f-4c89-97da-7a3be4fe667a","year":2025},"citing_paper":{"arxiv_id":"2605.24044","last_updated":"2026-05-21T20:44:39Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-21T20:44:39Z","title":"RED: Adaptive Real-Time DAG Scheduling for Robotic Inference under Environmental Dynamics","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T16:01:48.746926Z"},"links":{"cited_paper":"/paper/2507.21276","citing_paper":"/paper/2605.24044"},"observation_digest":"sha256:e2e46f4e9e76e9323223c1d37279c66adb67261d30e3bbd49b343f42f12063fe","observation_id":"fceeda55-34cf-45e2-ae9b-b7a5aad81518","resolution":{"observed_at":"2026-06-30T16:04:52.782024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21276","snapshot_observed_at":"2026-07-12T12:16:10.904456Z","title":"doi:10.48550/arXiv.2507.21276 , note =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02544","last_updated":"2026-06-24T05:57:19Z","snapshot_observed_at":"2026-08-07T01:41:05.813944Z","submitted_at":"2026-06-24T05:57:19Z","title":"Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-12T12:16:10.904456Z"},"links":{"cited_paper":"/paper/2507.21276","citing_paper":"/paper/2607.02544"},"observation_digest":"sha256:0d12f79a21e325ae31e90e578011fe63e1d95945c5b9c5bc61653f27e664133b","observation_id":"1fc58a18-4a8f-404e-bc48-da02ced20a4c","resolution":{"observed_at":"2026-07-12T12:16:10.904456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21276/citation-record","integrity":"/paper/2507.21276/integrity","json":"/paper/2507.21276/citation-record.json","paper":"/paper/2507.21276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:35.958154Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:35.958154Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:af2dda9184e8830e5ac59cce74044427716b4ee65315bb8e54f82cc6c6dddc15","observation_id":"177d1b42-c342-480a-88ef-819c21259556","resolution":{"observed_at":"2026-08-06T13:03:35.958154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:36.097595Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.097595Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:c139069375257dc7342250eb867f6a475c5795fe17a81f86e230c009d8053612","observation_id":"b12168bc-f0b5-49b5-9af6-8045c652343a","resolution":{"observed_at":"2026-08-06T13:03:36.097595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:56.658600Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":"4a25287a-478b-4b2c-9fc1-44a8a2a6b285","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.184733Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:d01655cf3376fdc1fc4141d07b4ee95789a9de6feec90840392b28e875a54f13","observation_id":"e11d4212-2a6a-4316-ba6d-82c0daeea771","resolution":{"observed_at":"2026-08-06T13:03:56.743274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:56.492858Z","title":"Test- time training with self-supervision for generalization under distribution shifts,","venue":null,"work_id":"bf3708a5-179c-47a3-828d-a133448e9c27","year":2020},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.288707Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:33bc0b29e5c1e6462051f5b6be68bc3190906118b9cf2f6cd6503746d3c8a5de","observation_id":"20a54e55-2ca8-44f8-8656-281595118176","resolution":{"observed_at":"2026-08-06T13:03:56.565551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07279","last_updated":"2025-03-25T03:36:21Z","snapshot_observed_at":"2026-08-05T02:24:21.044775Z","submitted_at":"2024-11-11T18:59:45Z","title":"The Surprising Effectiveness of Test-Time Training for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07279","snapshot_observed_at":"2026-08-06T13:03:36.469588Z","title":"The surprising effectiveness of test-time training for abstract reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.469588Z"},"links":{"cited_paper":"/paper/2411.07279","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:de73cee0da54237dbd109308f46a78ef8fa76796511f93ffcbddf814d63f48b5","observation_id":"2baf4354-e480-4f73-a687-1a363a2de7a7","resolution":{"observed_at":"2026-08-06T13:03:36.469588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:56.300015Z","title":"Machine learning model training over time,","venue":null,"work_id":"abec51af-24cc-4d01-a8a4-6b898f4806a9","year":2018},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.606463Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:e299f663fecf3768a22042fe3b27ae8b12955de13fb8ff96b23fef352a01b2c0","observation_id":"43f81271-6de4-4091-b2bc-d12b07540d97","resolution":{"observed_at":"2026-08-06T13:03:56.365685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01611","last_updated":"2021-09-01T04:46:46Z","snapshot_observed_at":"2026-07-06T11:44:08.760740Z","submitted_at":"2021-09-01T04:46:46Z","title":"Multi-model Machine Learning Inference Serving with GPU Spatial Partitioning","version":1},"cited_work":{"arxiv_id":"2109.01611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.01611","snapshot_observed_at":"2026-08-06T13:03:47.533047Z","title":"Multi-model Machine Learning Inference Serving with GPU Spatial Partitioning","venue":"cs.DC","work_id":"b28e4fd6-965d-4ed3-a102-dd9b192666ce","year":2021},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.716729Z"},"links":{"cited_paper":"/paper/2109.01611","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:aed7b22790d913f3d6568d3d424cb577244e413123eb7bdb29cbedb46bdd32bd","observation_id":"8a004639-5a0c-45bf-9703-cf6f9986f584","resolution":{"observed_at":"2026-08-06T13:03:47.613837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"ba-p/3631401","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:47.359471Z","title":"Optimized training and inference of hugging face models on azure,","venue":null,"work_id":"e541ab58-c082-45de-b923-9d354d4a3b19","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.806663Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:909611bd0d3a268df32d138ce2edd2c3056f84b60ece66c5a9ebc4c669cfede2","observation_id":"c0be8ee7-1c90-4dfe-9855-a575f804eebf","resolution":{"observed_at":"2026-08-06T13:03:47.423391Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:56.074450Z","title":"Train a model with amazon sagemaker,","venue":null,"work_id":"ec3a159a-3d26-4d4b-ab71-7cc0933ecbcf","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:36.944082Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0353ef9bcc42ca976ac9eec11cdee1f1ba831d3e241dc376e6b1deb665e6de53","observation_id":"799ebf13-ca01-4435-8dac-21f908d25fca","resolution":{"observed_at":"2026-08-06T13:03:56.165680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:55.847607Z","title":"Serving heterogeneous machine learning models on Multi-GPU servers with Spatio-Temporal sharing,","venue":null,"work_id":"334cbdd7-d6c5-46f0-8780-44c90f70b024","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:37.146527Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:5c404268f0fd872723568e64de0a1f83386d759959fe26507d56355f48874a4b","observation_id":"9e3680e2-0995-4e85-996e-bb8f3ac9e61a","resolution":{"observed_at":"2026-08-06T13:03:55.966697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:37.323683Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:37.323683Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:ddf6ca0e5cf1cba86dbe1d8de26ae918298d03848d9282b563055bbdf3288725","observation_id":"e4b54b5a-1239-442d-9f64-41da400ef0d1","resolution":{"observed_at":"2026-08-06T13:03:37.323683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:55.644197Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":"851e9788-ded8-462e-b0b3-967a37fbfecc","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:37.553106Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:44f3874475b62066f1c8ae6eba9b75f03ff268891c849ea56c21cef6f95ac277","observation_id":"3b9b2ad3-bb39-4cbb-a98d-1e1f0f425b63","resolution":{"observed_at":"2026-08-06T13:03:55.748090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:55.451183Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"c3ed1168-b095-4906-afa7-440af4485b71","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:37.722838Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:df7bd6e842eb631142a4edc1da3d06a7b75ed5b4c00db67571ced6e5c04f7b15","observation_id":"2e54d2b0-a006-4aea-b32f-5bf99d7d6851","resolution":{"observed_at":"2026-08-06T13:03:55.534034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:37.858647Z","title":"Taming {Throughput-Latency} tradeoff in {LLM} inference with {Sarathi-Serve},","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:37.858647Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0cf5d49f423e8aed69e9cf1a2295bbafffba6432e227b5e340af30c1a2b0a27a","observation_id":"5e4f8bd2-b03a-41c1-a841-cbf4ab8559ec","resolution":{"observed_at":"2026-08-06T13:03:37.858647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:55.260492Z","title":"{dLoRA}: Dynamically orchestrating requests and adapters for {LoRA}{LLM} serving,","venue":null,"work_id":"0901dfd6-405e-449b-99b7-7f31162323f4","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.004123Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:821034f2b838662a272359307789c0e97c9287e6004af0e6f70686549a8686c8","observation_id":"2618bdb3-1e07-4b1c-ac46-8ba37440dc27","resolution":{"observed_at":"2026-08-06T13:03:55.338659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:55.038041Z","title":"{ServerlessLLM}:{Low-Latency} serverless inference for large language models,","venue":null,"work_id":"811ceab5-d2a2-4559-8292-4c161df7bfce","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.092134Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:98accd394142320006e6c5409f018c8069576979eef2915a13f13bb24553cd70","observation_id":"2aa118aa-acff-4367-9dfb-9143caec705a","resolution":{"observed_at":"2026-08-06T13:03:55.177580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:54.860289Z","title":"Orca: A distributed serving system for Transformer-Based generative models,","venue":null,"work_id":"812be907-86c0-4275-8d45-acbf29f8702b","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.187808Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:af8341b18cbf4ed64392e85dbaf59d53f15748c5ca62c9685ddcd9007dd68e3f","observation_id":"c20a0451-bb56-44c3-8e7d-a83ed5e9d262","resolution":{"observed_at":"2026-08-06T13:03:54.948562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.09786","last_updated":"2017-06-22T17:34:30Z","snapshot_observed_at":"2026-08-01T14:35:07.577402Z","submitted_at":"2017-05-27T08:10:40Z","title":"AMPNet: Asynchronous Model-Parallel Training for Dynamic Neural Networks","version":3},"cited_work":{"arxiv_id":"1705.09786","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.09786","snapshot_observed_at":"2026-08-06T13:03:47.064029Z","title":"AMPNet: Asynchronous Model-Parallel Training for Dynamic Neural Networks","venue":"cs.LG","work_id":"7ce68912-2bb4-419f-8753-be4cc7d7f49d","year":2017},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.361567Z"},"links":{"cited_paper":"/paper/1705.09786","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0c72beab61650337e92e61eaaec718133c578da0a4f7332ef70cc7586247199a","observation_id":"5b4ceab4-6b39-48e1-8a9a-62e743bea3fd","resolution":{"observed_at":"2026-08-06T13:03:47.160939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:38.551490Z","title":"Pipedream: generalized pipeline parallelism for dnn training,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.551490Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:d3632a7be922f5a1a8ebb725b868170e41815e61266ed152a89987fca69d1681","observation_id":"6701e1d6-dde6-41e0-8ce1-724e10dbb90d","resolution":{"observed_at":"2026-08-06T13:03:38.551490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T13:03:38.747768Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.747768Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0bed65fe83a94b39921cf73b4bebf0b0def95acb05d6bae17a58fbd8f572a715","observation_id":"ef37bd81-b7b8-4d1d-b645-7e295918b987","resolution":{"observed_at":"2026-08-06T13:03:38.747768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:54.666370Z","title":"Varuna: scalable, low-cost training of massive deep learning models,","venue":null,"work_id":"e5e70b14-e518-4022-a94a-f205e890f55d","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:38.982766Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:1f12f82f20fb14cd5d3a3b2e2c7523e8fb814400e60de627c858d23cc802142e","observation_id":"0a7a3cb3-3862-4ccf-bfd2-7bdf2fefd259","resolution":{"observed_at":"2026-08-06T13:03:54.734717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:54.408667Z","title":"{EnvPipe}: Performance-preserving {DNN} training framework for saving energy,","venue":null,"work_id":"df5e2f43-48e1-49a0-9737-014d3a624eae","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.085310Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:d95553d0157267964deed708561b5d30e9dfb5a4f457b9f630346c6fc052a071","observation_id":"e73fc8bc-5437-4f6a-8469-f286dd7a341e","resolution":{"observed_at":"2026-08-06T13:03:54.514639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:54.167630Z","title":"{AlpaServe}: Statistical multiplexing with model parallelism for deep learning serving,","venue":null,"work_id":"31062029-5645-4792-a701-8de275890bff","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.265093Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:7d63aad0eedf3c8837989753b3ff898038667773fa822002882606b1747a311c","observation_id":"d33eb98e-cb67-4e37-be45-faa7d410c8d0","resolution":{"observed_at":"2026-08-06T13:03:54.283477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:53.940293Z","title":"Merak: An efficient distributed dnn training framework with automated 3d parallelism for giant foundation models,","venue":null,"work_id":"6c41b105-7a63-4acc-a46a-dae09c22b986","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.431790Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:1f881261f4f58e6a41946b50e9af21a0a59ca695c560fd553a45746827bc60ff","observation_id":"41ebbb8a-601c-4fea-a59d-d2e11e5e4f3d","resolution":{"observed_at":"2026-08-06T13:03:54.031745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:53.701900Z","title":"Gpipe: Efficient training of giant neu- ral networks using pipeline parallelism,","venue":null,"work_id":"ae577ac8-3d2e-4cec-97c3-8e0f08cca420","year":2019},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.527881Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:ce027fa0ecf6ef872f940a003f3913e213e2535a70cc1985c172bd6bb66ca366","observation_id":"c7de026b-bd1c-4557-8642-b5c46516a0f3","resolution":{"observed_at":"2026-08-06T13:03:53.791832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T13:03:39.613622Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.613622Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:bef111231260bce409e5fd6475ae2025c979eb1ec71ea36be200508c105e0643","observation_id":"38659fbb-96cb-41c6-9abb-510b9a159129","resolution":{"observed_at":"2026-08-06T13:03:39.613622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:53.452883Z","title":"Lmsys-chat-1m: A large-scale real-world llm conversation dataset,","venue":null,"work_id":"511146fc-099e-43a9-b7e0-8d924a0ef527","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.799667Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:a4e646938f7b5366d5491c1eb62e41328b9e63e67e706fda0b09489ebf722dd0","observation_id":"6ef29b9d-8232-45e2-b465-319bc18765b2","resolution":{"observed_at":"2026-08-06T13:03:53.585506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:39.957147Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:39.957147Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:69d7678d674074e60d89838fc1c20cd077f9bc21d9200ec9f1a46590b066e54e","observation_id":"aa35d284-238d-417a-8c01-fc588cd9d932","resolution":{"observed_at":"2026-08-06T13:03:39.957147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:53.027533Z","title":"Fairness in serving large language models,","venue":null,"work_id":"4eb9cfc4-b66f-4204-867a-c1851960d573","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:40.145040Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:db486bb3fc0215c625a35848bdcf0a4ec792b927a73e292d2ff2b5186f440cf6","observation_id":"c86bfd86-13c9-4906-a291-c64f5cb3152e","resolution":{"observed_at":"2026-08-06T13:03:53.185402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:52.772351Z","title":"Large language models empowered autonomous edge ai for connected intelligence,","venue":null,"work_id":"662bbe16-7723-4b24-8c1b-10b193999695","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:40.276469Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:38085535d23e1c3df2fe4881370944e3b6dd1a49ddfeaa7446f12bc2eb8002fa","observation_id":"22c0a8d6-5c64-411a-8d6a-39b0c21083ab","resolution":{"observed_at":"2026-08-06T13:03:52.868593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:40.340778Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:40.340778Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:800309c0f5227279a4a2de98994d4105e8d1c18ddf7d7086c7bcb30cff27471d","observation_id":"65bd21a4-870d-40b3-8119-3b9bd4af99b5","resolution":{"observed_at":"2026-08-06T13:03:40.340778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06781","last_updated":"2025-03-09T21:23:52Z","snapshot_observed_at":"2026-08-07T17:18:30.123530Z","submitted_at":"2025-03-09T21:23:52Z","title":"Dr Genre: Reinforcement Learning from Decoupled LLM Feedback for Generic Text Rewriting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06781","snapshot_observed_at":"2026-08-06T13:03:40.516658Z","title":"Dr genre: Reinforcement learning from decoupled llm feedback for generic text rewriting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:40.516658Z"},"links":{"cited_paper":"/paper/2503.06781","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:cbff89f36f32c4392540676317f776060ab8f7091f4de1f9b2e9b8bc2b6e5805","observation_id":"7bdf36ea-d166-4920-ab69-7a41e602e358","resolution":{"observed_at":"2026-08-06T13:03:40.516658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:52.630806Z","title":"Safe rlhf: Safe reinforcement learning from human feedback,","venue":null,"work_id":"7958cb9c-bf2c-45f2-ae26-0005bf4ea2ae","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:40.765503Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:017418ef5cf4e11619350964a596e953cd2c740c00906ad60a5b1a7fb2da252f","observation_id":"7cf8dc94-db69-4e77-bc92-f0ca869d00f8","resolution":{"observed_at":"2026-08-06T13:03:52.686854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:52.499758Z","title":"Safety alignment in nlp tasks: Weakly aligned summarization as an in-context attack,","venue":null,"work_id":"bd5125fb-7aac-47cc-8914-1a4311182f7d","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:40.945089Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:1780e5615d9e9dd2d314e7b9390040501530fc14d16bed07d6f0476259ab9031","observation_id":"1931c4cc-f0f8-4aa2-89b4-6b883ce5c810","resolution":{"observed_at":"2026-08-06T13:03:52.558977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:52.231447Z","title":"Beyond data and model parallelism for deep neural networks","venue":null,"work_id":"87b59e24-c32a-4aa0-9aa9-c2f7c3c5f9de","year":2019},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:41.145421Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:dcbc8a996944b3b9e393ea024a3ebaa277b958afeb9915661236de72d03407de","observation_id":"dc8ea10d-f524-4420-82fe-bb19d7fb0bd6","resolution":{"observed_at":"2026-08-06T13:03:52.376599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:51.924023Z","title":"How many servers are needed to run chatgpt?","venue":null,"work_id":"103c74cf-83e6-4623-a195-7bf9aba55d34","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:41.342039Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:7918f04dbdab719ec1ae620c3beac3d88592994ad8bd78f650af40332ed7208e","observation_id":"62402bcf-6d8f-4e78-b840-45221ac38601","resolution":{"observed_at":"2026-08-06T13:03:52.065583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T13:03:41.456851Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:41.456851Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0c88d92e63fd622eca23094bbf9f72edc36dcf60a97e637f56d0a72188384bac","observation_id":"a7a1e361-6c28-44d8-86d4-baa6275d5343","resolution":{"observed_at":"2026-08-06T13:03:41.456851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:51.681055Z","title":"Understanding dataset difficulty with V-usable information,","venue":null,"work_id":"ba174fe1-eeb3-4f67-942f-48a58863d991","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:41.603740Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:c326a438376043da2649915d441df4b1f642efeaf6e2e7e9aa1900153ba54341","observation_id":"fec44e91-1914-424d-b7c5-2bb5f2af80f8","resolution":{"observed_at":"2026-08-06T13:03:51.769600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:41.731363Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:41.731363Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:f0328d67349fd2cb74733226a889db4c675d5d86e12959e489026df3458f6141","observation_id":"db6d5645-20d7-4db9-9fd5-33cdf4bbf17b","resolution":{"observed_at":"2026-08-06T13:03:41.731363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:51.389947Z","title":"Transparent {GPU} sharing in container clouds for deep learning workloads,","venue":null,"work_id":"366d2b60-4ef2-42f2-bed0-b68e229c838a","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:41.881055Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:125a5430367bb0b709cba47f4f4eebb1c0c04f1803b2eb9e8d5629e781f1f80b","observation_id":"b5d17bd8-30fb-410b-b304-ab4c4ae30408","resolution":{"observed_at":"2026-08-06T13:03:51.490567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:42.047920Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.047920Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:c2b44959f91f010c102ec50d56f9a2acae7a432b6af252f4e7e060bd066d05df","observation_id":"52e1ffe4-71a8-4491-94e0-265ca36e1d37","resolution":{"observed_at":"2026-08-06T13:03:42.047920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:51.043889Z","title":"Methods and infrastructure in the era of accelerator-centric architectures,","venue":null,"work_id":"6e77529c-7d3a-4c3c-a7b5-bb4089026db8","year":2017},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.293530Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:2c62761ff452c9a09901b0e558cb0cc5fa788d040950c810b96d693ad6936c5d","observation_id":"fed08b25-c7f6-4efd-a7af-aabb6d642953","resolution":{"observed_at":"2026-08-06T13:03:51.195820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:50.867015Z","title":"Rt-lm: Uncertainty-aware resource management for real-time inference of language models,","venue":null,"work_id":"3647e18f-c4ef-47b7-aacd-2546af843dd1","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.367020Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:2a8c0d05dc9b20568e498167bfbd4289cf2a5eaede9414c3de45c5715a1589e6","observation_id":"4fe6ae8a-8781-4d0c-bc7a-b3f930bda0bc","resolution":{"observed_at":"2026-08-06T13:03:50.924196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19513","last_updated":"2025-03-05T03:40:47Z","snapshot_observed_at":"2026-08-07T17:45:06.357673Z","submitted_at":"2025-02-26T19:25:27Z","title":"Mixtraining: A Better Trade-Off Between Compute and Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19513","snapshot_observed_at":"2026-08-06T13:03:42.479866Z","title":"Mixtraining: A better trade-off between compute and performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.479866Z"},"links":{"cited_paper":"/paper/2502.19513","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:b0860e0297295380ede2e8741c87294a54d96f2f5b73164eb15bb493692a084c","observation_id":"9db6ea39-66d1-4a1e-bbd7-00c40156c28b","resolution":{"observed_at":"2026-08-06T13:03:42.479866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:50.608869Z","title":"Sglang: Efficient execution of structured language model programs,","venue":null,"work_id":"b764851d-6c6b-44e9-9b77-fe33dc5e75fc","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.609614Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:e9f7e431bbc35692a0deb803a46b9e57d0dd88d589c62b11d7b337b4ac5a8e19","observation_id":"e2705dc9-e105-41ea-864d-908d1d0bc6ed","resolution":{"observed_at":"2026-08-06T13:03:50.710272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:50.465292Z","title":"{Check-N-Run}: A checkpointing system for training deep learning recommendation mod- els,","venue":null,"work_id":"fbec3184-cb94-4c25-9ea6-3df08eb85388","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.727557Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:827c0bbdff19905232beffa1a9304e5b8bc2d57d5cfd4d70e8d3173d6e0f663d","observation_id":"65f29f82-f46e-4f28-8d50-1f3465d682cf","resolution":{"observed_at":"2026-08-06T13:03:50.520601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:42.847099Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.847099Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:e9733bb065f951a6573e1efa686d313c6a6583f7d45acd35574a621e90eceab9","observation_id":"ce2f717d-c000-498c-92dd-4ea744903f5b","resolution":{"observed_at":"2026-08-06T13:03:42.847099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:42.963397Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:42.963397Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:d2bb34075e91f0112b6711e833e0820f9c0225965aea70634584fc51c005b711","observation_id":"2d5b3269-9b38-4ceb-adf1-f853eff0e6a5","resolution":{"observed_at":"2026-08-06T13:03:42.963397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:43.087636Z","title":"Dialogpt: Large-scale generative pre- training for conversational response generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.087636Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:dab21e263d777ad6bc32be18a4e5c7105e0c75cc629541deae8d6d57baa9c69f","observation_id":"d45ce188-3d1f-4609-842d-02025234a453","resolution":{"observed_at":"2026-08-06T13:03:43.087636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:50.307805Z","title":"Utilitiy accrual scheduling with real-time java,","venue":null,"work_id":"35a2b4f9-e003-4876-afe4-d9d5df29bfbc","year":2003},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.216500Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:488d10df0735deb362a196e0ae97551887ed4bf839798391bdb51890e998029f","observation_id":"0353e34e-c94c-40d1-b031-e51b4ae872e7","resolution":{"observed_at":"2026-08-06T13:03:50.358006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05799","last_updated":"2018-02-21T04:30:30Z","snapshot_observed_at":"2026-07-06T06:23:45.215820Z","submitted_at":"2018-02-15T23:36:51Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05799","snapshot_observed_at":"2026-08-06T13:03:43.354587Z","title":"Horovod: fast and easy distributed deep learning in tensorflow,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.354587Z"},"links":{"cited_paper":"/paper/1802.05799","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:1fd642ae971189d2234d5555d3002546764433798b994c615d2c9d9fa53d0123","observation_id":"2a755fdd-66e5-48a1-92db-d9ef7b64993c","resolution":{"observed_at":"2026-08-06T13:03:43.354587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:50.189625Z","title":"A unified architecture for accelerating distributed {DNN} training in heteroge- neous {GPU/CPU} clusters,","venue":null,"work_id":"66d4dfdb-6e37-4973-99dc-8b0d7a5c73b9","year":2020},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.484566Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:27b178d3998afe30d87ae97d043ed743d605be72b671aa2830078a4b05aa96fc","observation_id":"ff1db69a-9c26-4c75-9990-096370ff24d4","resolution":{"observed_at":"2026-08-06T13:03:50.246190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:43.601662Z","title":"Large scale distributed deep networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.601662Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:078870da7026da71a085dabf5ac862dff0707420ccad731afd4064b9d87d3ca2","observation_id":"b9a55956-b488-4879-85f8-f075b95f685a","resolution":{"observed_at":"2026-08-06T13:03:43.601662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:50.034325Z","title":"Chimera: efficiently training large-scale neural net- works with bidirectional pipelines,","venue":null,"work_id":"ad9467e7-08c2-40c4-b555-0e1ec87bb4e7","year":2021},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.773979Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0e045e238d417e516837c48785636ca134fc26ceaf4afddd32a92b91ae9763df","observation_id":"abe4b508-1579-461f-8352-0f86adc20c30","resolution":{"observed_at":"2026-08-06T13:03:50.100215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.906758Z","title":"Pipefisher: Efficient training of large language models using pipelining and fisher information matrices,","venue":null,"work_id":"a893a9ef-9574-4fb5-8118-977c32538dfb","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:43.975036Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:e3e2882121001433b4939e6c1b5b6d7bd7a9ebe96df84af6bc4c8780ea9b4c76","observation_id":"cffc585c-f4f4-42f2-a272-5cdaa0601a1c","resolution":{"observed_at":"2026-08-06T13:03:49.970281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.799809Z","title":"Torch- serve: Serve, optimize and scale pytorch models in production,","venue":null,"work_id":"75db4b58-e375-4ce4-8836-23d29d9fd925","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.056961Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:5a87ff094f7507328efe7f416c7c01b31162c47dc42d66d868af069e368bb4e6","observation_id":"bbaefcef-2f47-4072-b644-ab0b34c23c9a","resolution":{"observed_at":"2026-08-06T13:03:49.850981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.658971Z","title":"Triton inference server: An optimized cloud and edge inferencing solution,","venue":null,"work_id":"708f9ec7-beac-4ce0-b145-328788f5d443","year":2019},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.143282Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:a8356fabdb2809b5120ffbac26c298534afd703f33fdfbe70a92508d85870773","observation_id":"d3721f57-b094-4cb0-ac8c-66431528be16","resolution":{"observed_at":"2026-08-06T13:03:49.719470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.536191Z","title":"White-box multi-objective adversarial attack on dialogue generation,","venue":null,"work_id":"a51625ed-92e5-4651-8534-22fd39bf1f68","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.313731Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:096680787e779d4ccf77a692a6a3880cc1cd62bc0696cffbc3198b2950787a26","observation_id":"b4349fc9-e916-40fa-8e0c-1978f15d864f","resolution":{"observed_at":"2026-08-06T13:03:49.575798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.399425Z","title":"Dycl: Dynamic neural network compilation via program rewriting and graph optimization,","venue":null,"work_id":"f372efbf-ee15-4f78-8d3b-5d34d5bdb773","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.449347Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:8fd5a219a47108c7f25ee92994aede239379312ad51667b83c990c735e63cb02","observation_id":"15958372-4cf4-4e87-a8e6-b5dcdefd9298","resolution":{"observed_at":"2026-08-06T13:03:49.458564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10364","last_updated":"2022-12-03T01:32:11Z","snapshot_observed_at":"2026-08-01T14:56:30.499921Z","submitted_at":"2022-05-20T04:17:19Z","title":"Learning to Reverse DNNs from AI Programs Automatically","version":2},"cited_work":{"arxiv_id":"2205.10364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.10364","snapshot_observed_at":"2026-08-06T13:03:46.668128Z","title":"Learning to Reverse DNNs from AI Programs Automatically","venue":"cs.LG","work_id":"e2a06bbe-6828-421b-b298-e1070a57bc07","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.537815Z"},"links":{"cited_paper":"/paper/2205.10364","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:0b57a11a0a32d37aec19ad08284e5c8b04c783def0a9ffdc88a0a5982603d87c","observation_id":"0b89d23d-7aa1-4cf9-93a3-8d471fb102e3","resolution":{"observed_at":"2026-08-06T13:03:46.789593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:44.686906Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.686906Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:211383a253d8f869d60a9545be748272a33a61ae7d6384fc87193251126a7aab","observation_id":"77e4e8de-38bf-43ee-b925-d9caa3e9db32","resolution":{"observed_at":"2026-08-06T13:03:44.686906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.235023Z","title":"Integrated optimization of large language models: Synergizing data utilization and compression techniques,","venue":null,"work_id":"e7438d6d-5416-48db-8b7d-b90febe60113","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:44.832888Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:f498233883e761fcafcc0ad5572eecdc968576038295ebd22686ac7a016817ff","observation_id":"853ef611-457a-4715-9eca-e4fc69e9440e","resolution":{"observed_at":"2026-08-06T13:03:49.288771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-07-06T15:25:24.491136Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-06T13:03:45.031929Z","title":"Fast distributed inference serving for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.031929Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:526042cb04459b8e898b6f121c2a503afd588d86cc476a1712a6bdb12777b280","observation_id":"876f09a7-d912-4c49-aebb-f76a48e4f186","resolution":{"observed_at":"2026-08-06T13:03:45.031929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:45.197515Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.197515Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:7190f8b218ac839752342456f35f1f020037fb99dc6441f4b9c3246f73e9aa98","observation_id":"443bb644-52a2-45b2-91d6-18148ab830fd","resolution":{"observed_at":"2026-08-06T13:03:45.197515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:49.021353Z","title":"D´ej`avu: KV-cache streaming for fast, fault-tolerant generative LLM serving,","venue":null,"work_id":"b9c69477-fd56-4bd5-a6ac-0b4da87f0ee2","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.280433Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:eebe127e35539497bc4470ad1322433fd2a7bd56ca355e2d28d72cbfd2f852b6","observation_id":"c5c254a4-c74a-4d8d-9d94-206c535ad5d0","resolution":{"observed_at":"2026-08-06T13:03:49.075642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10989","last_updated":"2021-07-23T01:50:22Z","snapshot_observed_at":"2026-07-06T11:31:46.316473Z","submitted_at":"2021-07-23T01:50:22Z","title":"Estimating Predictive Uncertainty Under Program Data Distribution Shift","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10989","snapshot_observed_at":"2026-08-06T13:03:45.389549Z","title":"Estimating predictive uncertainty under program data distribution shift,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.389549Z"},"links":{"cited_paper":"/paper/2107.10989","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:5a9b80c7adf7d29ae20464f952d16530951da7f4f0b6284948581713586f2084","observation_id":"029d8a30-6b03-45b2-8e6e-24de8dc0c5de","resolution":{"observed_at":"2026-08-06T13:03:45.389549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05939","last_updated":"2024-01-12T00:00:32Z","snapshot_observed_at":"2026-08-03T13:36:03.138850Z","submitted_at":"2024-01-12T00:00:32Z","title":"Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study","version":1},"cited_work":{"arxiv_id":"2402.05939","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05939","snapshot_observed_at":"2026-08-06T13:03:46.461152Z","title":"Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study","venue":"cs.SE","work_id":"3fbe2ad5-06a8-4e95-8267-0416f2fa5bea","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.485554Z"},"links":{"cited_paper":"/paper/2402.05939","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:e91cdb6a63fa5895582aa63bd019a3b5fcf7fe8aa3db559a0427231eca141549","observation_id":"c7234d1d-9817-47f3-89e6-27b0ff694747","resolution":{"observed_at":"2026-08-06T13:03:46.522459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:48.821225Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":"60be9555-1064-40bc-b6ea-196e641b9d53","year":2015},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.597334Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:e4d716e49066b315f04879d23aaedc0d5a47752836e112b284b78744ddc0d2ff","observation_id":"dfe2d45a-e540-44d6-9af9-e7d48c1d79c6","resolution":{"observed_at":"2026-08-06T13:03:48.946769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6211","last_updated":"2015-03-04T01:43:31Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T06:31:41Z","title":"An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6211","snapshot_observed_at":"2026-08-06T13:03:45.705445Z","title":"An empirical investigation of catastrophic forgetting in gradient-based neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.705445Z"},"links":{"cited_paper":"/paper/1312.6211","citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:6f3ed1bd5e5e0b0e86210d09d67d3b034857526f0baa8cbda8896079c9e9c51a","observation_id":"f721397d-d94f-4df2-8a41-48c197a3e724","resolution":{"observed_at":"2026-08-06T13:03:45.705445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:48.591386Z","title":"Uncertainty-aware bootstrap learning for joint extraction on distantly-supervised data,","venue":null,"work_id":"28e3a533-fb51-4e45-a99c-35a457e56ce7","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.810863Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:4a7f0fb59eb226b720d2326e10a4be849e0502fa7f3e88794ae0a2df743fd894","observation_id":"f64b7f9c-f1e4-4bf2-830b-72d0877e159d","resolution":{"observed_at":"2026-08-06T13:03:48.712845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:48.349770Z","title":"Distantly- supervised joint extraction with noise-robust learning,","venue":null,"work_id":"d726848f-23ae-49b6-953c-396aefeb5ef0","year":2024},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.909109Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:c354dd30f6b7194a21a53dcdae17d1da85ad1f9a4e3c7d91da681b415a71f13d","observation_id":"549a8957-4cbb-4f35-9c03-4eb5f81cff81","resolution":{"observed_at":"2026-08-06T13:03:48.437621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:48.113411Z","title":"Ekya: Continuous learning of video analytics models on edge compute servers,","venue":null,"work_id":"2edf34fd-26d5-4f87-a557-b1a90c48840f","year":2022},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:45.995394Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:95f3bad342117b2a1b459e3835c7189d011e30a1eb09113038b0760acbca3fec","observation_id":"a180dc1d-6dfd-4ad4-b007-6b7ecdf4460c","resolution":{"observed_at":"2026-08-06T13:03:48.265882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:47.950700Z","title":"Adainf: Data drift adaptive scheduling for accurate and slo-guaranteed multiple-model inference serving at edge servers,","venue":null,"work_id":"157beef0-68bb-4a22-8f03-5bb9d0823413","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:46.106072Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:1b5111de50e9994286aff76389f7e92487ebf134e6ddf5005bea923fb4e56f19","observation_id":"87266bc5-16d4-462b-b0c4-f14522eac508","resolution":{"observed_at":"2026-08-06T13:03:48.003626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:03:47.766155Z","title":"Lyra: Elastic scheduling for deep learning clusters,","venue":null,"work_id":"dafd11d2-872c-4964-9570-d333850b466b","year":2023},"citing_paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:03:46.238908Z"},"links":{"citing_paper":"/paper/2507.21276"},"observation_digest":"sha256:05e126b5ee0dfcce9281b3a65915a07dbbe31520d7979a5902c0c4ad8b68adde","observation_id":"d33fcda8-3861-46ff-9d9c-0282282f654f","resolution":{"observed_at":"2026-08-06T13:03:47.824164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21276","last_updated":"2025-07-28T19:03:26Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T13:03:30.357030Z","submitted_at":"2025-07-28T19:03:26Z","title":"LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":5,"verified_fuzzy":44},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 3 inbound Pith citation observations for arXiv:2507.21276."}