{"as_of":"2026-08-19T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:532d984282d031e2cbccc49d465ef9e1287284582bc37d34744be36f10e26064","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:16:55.968542Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09420/citation-record","integrity":"/paper/2509.09420/integrity","json":"/paper/2509.09420/citation-record.json","paper":"/paper/2509.09420"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T19:16:53.978741Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:53.978741Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:cd7aff1c23b9127e96d1472e51979eb561143b998fca28ab60ee0846a9f9d2a5","observation_id":"c023fad7-e42f-4af1-91e1-f30712da59c3","resolution":{"observed_at":"2026-08-04T19:16:53.978741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-04T19:16:54.034317Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.034317Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:b66f851bb76ee80cb282cabff95c937c6f773b97ea29eb23154e150c7866c117","observation_id":"cc95a5cd-9a8a-4919-8671-0fd2e916564b","resolution":{"observed_at":"2026-08-04T19:16:54.034317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:54.123728Z","title":"1.1 computing’s energy problem (and what we can do about it),","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.123728Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:1b15bf7c64f49d773be63997b9073b67017195577edbcb7c907a9dafdc259887","observation_id":"c9223967-e2e5-404c-91f1-74b5f48ccdbc","resolution":{"observed_at":"2026-08-04T19:16:54.123728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:54.207966Z","title":"Near- memory computing on fpgas with 3d-stacked memories: Ap- plications, architectures, and optimizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.207966Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:46d01aa2d0fe93f81a0c01fc84fc2a21e83d10f09eae9b7b70e15196d5561906","observation_id":"648d718b-9cb3-415e-8a45-de80bf678ca6","resolution":{"observed_at":"2026-08-04T19:16:54.207966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-04T19:16:54.346068Z","title":"Megatron-lm: Training multi-billion param- eter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.346068Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:dc3ce21625ec31c1e4cdaccb8bc606b571fb629bae2767c503d2fb22af4a73a1","observation_id":"8c005d75-46d8-4b02-8e66-8267716ce092","resolution":{"observed_at":"2026-08-04T19:16:54.346068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-04T19:16:54.437114Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.437114Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:dde5feb12d4d57c36351751b0d1bea8c17c620177d2c1fbb3d2cd8f502543808","observation_id":"868f603e-6201-4cf9-b30d-af78ff293680","resolution":{"observed_at":"2026-08-04T19:16:54.437114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:54.528051Z","title":"Adapmoe: Adaptive sensitivity-based expert gating and man- agement for efficient moe inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.528051Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:6a06f88ae345276431b83cb311184ad89ca160551ffce60e7f6b941e5a32c45a","observation_id":"35deddcf-3cdb-4a0d-97fc-b175cceb5950","resolution":{"observed_at":"2026-08-04T19:16:54.528051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15715","last_updated":"2024-11-24T04:53:10Z","snapshot_observed_at":"2026-08-19T12:41:31.082950Z","submitted_at":"2024-11-24T04:53:10Z","title":"Task Scheduling for Efficient Inference of Large Language Models on Single Moderate GPU Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15715","snapshot_observed_at":"2026-08-04T19:16:54.612324Z","title":"Task scheduling for efficient inference of large language models on single moderate gpu systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.612324Z"},"links":{"cited_paper":"/paper/2411.15715","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:bd46c9877003d9f068f92cce1fa8c3d3a075d63efa2434e297b5294a248d720f","observation_id":"ad2c06d2-4f6e-4a83-b3c2-cd3417e7323b","resolution":{"observed_at":"2026-08-04T19:16:54.612324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10375","last_updated":"2025-05-04T09:49:42Z","snapshot_observed_at":"2026-08-18T19:53:19.290159Z","submitted_at":"2024-12-16T07:59:21Z","title":"DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10375","snapshot_observed_at":"2026-08-04T19:16:54.707195Z","title":"Daop: Data-aware offloading and predictive pre-calculation for efficient moe in- ference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.707195Z"},"links":{"cited_paper":"/paper/2501.10375","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:e392d89051f4c56c38c4e8bdddf43d6dc95763b9e3707b21921c0a9ae40edabd","observation_id":"21df77bd-7575-4408-817d-5eea93f53ce4","resolution":{"observed_at":"2026-08-04T19:16:54.707195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01433","last_updated":"2024-11-06T01:49:45Z","snapshot_observed_at":"2026-08-16T13:03:29.317209Z","submitted_at":"2024-11-03T04:25:46Z","title":"HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01433","snapshot_observed_at":"2026-08-04T19:16:54.812983Z","title":"Hobbit: A mixed precision expert offloading system for fast moe inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.812983Z"},"links":{"cited_paper":"/paper/2411.01433","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:5adeb71627bb52d417abc2f6f96c67ccf6b7498446918c4c5c711db339b3eab4","observation_id":"50eddfa0-7cf9-4198-978a-26934580ec3e","resolution":{"observed_at":"2026-08-04T19:16:54.812983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T19:16:54.942933Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:54.942933Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:54fe2e589702522f0f8d48476401c35d5da02084ae4ccfa4a96c1447d363952e","observation_id":"b750e429-49c5-437c-9696-c99f7cb15091","resolution":{"observed_at":"2026-08-04T19:16:54.942933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-04T19:16:55.009024Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.009024Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:272b52cbee9426b1cb7250678864bcb12c34317f8e6704fb9aaa773d8be81ef2","observation_id":"cd6e5e2e-36bb-47d3-a2b7-56376da3465f","resolution":{"observed_at":"2026-08-04T19:16:55.009024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05897","last_updated":"2025-04-08T10:47:37Z","snapshot_observed_at":"2026-08-16T12:43:03.903686Z","submitted_at":"2025-04-08T10:47:37Z","title":"HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05897","snapshot_observed_at":"2026-08-04T19:16:55.064846Z","title":"Hybrimoe: Hybrid cpu-gpu scheduling and cache management for efficient moe inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.064846Z"},"links":{"cited_paper":"/paper/2504.05897","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:8fd47c6662a2c52cd0c045a13fa4d8612c7415a56555f9b2bea7a4e0de1bb109","observation_id":"9964d58e-d9b0-44da-8b7a-ef29cd5b4439","resolution":{"observed_at":"2026-08-04T19:16:55.064846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12247","last_updated":"2025-01-03T06:19:14Z","snapshot_observed_at":"2026-08-17T18:12:52.995208Z","submitted_at":"2024-10-16T05:17:49Z","title":"EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12247","snapshot_observed_at":"2026-08-04T19:16:55.123761Z","title":"Eps-moe: Expert pipeline scheduler for cost-efficient moe inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.123761Z"},"links":{"cited_paper":"/paper/2410.12247","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:d02f1532363b3073c8753a5b56fae45c2ad35c172427ed0443efc626975696d4","observation_id":"39938ced-e2cb-4a12-b64c-37d5f53e01ee","resolution":{"observed_at":"2026-08-04T19:16:55.123761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06643","last_updated":"2025-02-10T16:34:36Z","snapshot_observed_at":"2026-08-17T14:17:02.656299Z","submitted_at":"2025-02-10T16:34:36Z","title":"MoETuner: Optimized Mixture of Expert Serving with Balanced Expert Placement and Token Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06643","snapshot_observed_at":"2026-08-04T19:16:55.187513Z","title":"Moetuner: Optimized mixture of expert serving with balanced expert placement and token routing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.187513Z"},"links":{"cited_paper":"/paper/2502.06643","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:c555d874ac2221aadfa8f8c931b12b319e5dcb3672950d9e335bf38afe44e56b","observation_id":"13b6405c-ff34-49f8-811e-c463f0119c21","resolution":{"observed_at":"2026-08-04T19:16:55.187513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05019","last_updated":"2025-05-29T04:25:16Z","snapshot_observed_at":"2026-08-17T14:22:23.553759Z","submitted_at":"2024-04-07T17:17:23Z","title":"Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05019","snapshot_observed_at":"2026-08-04T19:16:55.265118Z","title":"Shortcut-connected expert parallelism for accelerating mixture- of-experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.265118Z"},"links":{"cited_paper":"/paper/2404.05019","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:406df6ad118879343dc6c8fd036087acfff72fd446906ee7a4ab008c7162e1c3","observation_id":"b511cd5d-fc47-4c18-b843-9628e6c05bcf","resolution":{"observed_at":"2026-08-04T19:16:55.265118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.306591Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.306591Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:b4441040472d9817ede3b655ba8a5eaf9fa335db26799cda749a8119bb7a341d","observation_id":"fdf83db3-38a7-4543-b181-a7275d6628fc","resolution":{"observed_at":"2026-08-04T19:16:55.306591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.337181Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.337181Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:02bc86ba83ac5ef65f296e4197b9047e67261e541f3ff6f31b4569f310ca3ba0","observation_id":"b14e6847-d7fa-40b6-a19c-e66ec4f544c2","resolution":{"observed_at":"2026-08-04T19:16:55.337181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.387250Z","title":"Netmoe: Accelerating moe training through dynamic sample placement,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.387250Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:040b26b2936d6f3876868a897814065b795ad937344ae3e75c2e411b4501faff","observation_id":"5725ad46-9614-418c-a293-1b4b20c56505","resolution":{"observed_at":"2026-08-04T19:16:55.387250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.469355Z","title":"Samsung pim/pnm for transfmer based ai: Energy efficiency on pim/pnm cluster,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.469355Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:d1e81ad11d5717b29d1c63319093f5372f2cd7c732ea35a249ac8f7e4d45554f","observation_id":"23b3792a-05cb-4a57-af79-7107bfd2c085","resolution":{"observed_at":"2026-08-04T19:16:55.469355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.511861Z","title":"A stacked embedded dram array for lpddr4/4x using hybrid bond- ing 3d integration with 34gb/s/1gb 0.88 pj/b logic-to-memory interface,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.511861Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:9d6a9cc5dc71e40032b0f5d71a3456ce9d1ee2bfec3fe4b5dc15adb8b9cc9f05","observation_id":"1246a6e4-ffb2-4a65-8ab5-7feea4864155","resolution":{"observed_at":"2026-08-04T19:16:55.511861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.584274Z","title":"184qps/w 64mb/mm 2 3d logic-to-dram hybrid bonding with process-near-memory engine for recommendation system,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.584274Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:6359d51c2061b4a0cd51c13c14814ca16503105799cbe7161df8d6f7040a6650","observation_id":"ada569a1-975f-409f-b4ec-24430e250a57","resolution":{"observed_at":"2026-08-04T19:16:55.584274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.636411Z","title":"Exploiting similarity opportunities of emerging vision ai models on hybrid bonding architecture,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.636411Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:8fe9c09f1366d02bedd144edd45f0c1c0662b4b42cccf922bd7f8945de92c95c","observation_id":"7a647bae-3091-4ebf-b727-a4aa758f498f","resolution":{"observed_at":"2026-08-04T19:16:55.636411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.703749Z","title":"H2-llm: Hardware-dataflow co- exploration for heterogeneous hybrid-bonding-based low-batch llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.703749Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:f5e3825ca6531aa8be8e58965ecd445ed460ede9839ab63efa91f900dfcd3316","observation_id":"625e7d78-ba1c-46a1-93b1-226d046f6478","resolution":{"observed_at":"2026-08-04T19:16:55.703749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-04T19:16:55.758949Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.758949Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:1cf464e75b50fe3baa57e6b27ae3449bf69ceb41d2e2ce853ba0c5d119cc4558","observation_id":"c2fdafc8-2394-4fb8-9d3f-6f5e16e651b8","resolution":{"observed_at":"2026-08-04T19:16:55.758949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.802746Z","title":"Collec- tive communication on architectures that support simultaneous communication over multiple links,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.802746Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:337b982355a96c3feca12fbca5c6a7c110d9733ef366d619e5f49d1b9a79e322","observation_id":"6040e835-9af4-4422-a13c-ecb910596444","resolution":{"observed_at":"2026-08-04T19:16:55.802746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.913639Z","title":"Astra- sim: Enabling sw/hw co-design exploration for distributed dl training platforms,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.913639Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:e1263f99de4d12de62d84519dd882333f0d7bdcefcbe243502b917ec4d1605ae","observation_id":"518b3eac-fd3e-4f57-8556-34896c311998","resolution":{"observed_at":"2026-08-04T19:16:55.913639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:16:55.968542Z","title":"Judging llm-as- a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:16:55.968542Z"},"links":{"citing_paper":"/paper/2509.09420"},"observation_digest":"sha256:9d0e66e6468dfaf0704d8d530cec68bd1a1a44982af7cf39f4bc34a762a159f9","observation_id":"7b94c5cc-7628-465d-be71-6e634afd80d3","resolution":{"observed_at":"2026-08-04T19:16:55.968542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09420","last_updated":"2025-09-11T13:01:55Z","latest_version":1,"primary_category":"cs.PF","snapshot_observed_at":"2026-08-15T17:04:05.270458Z","submitted_at":"2025-09-11T13:01:55Z","title":"HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.09420."}