{"as_of":"2026-08-16T01:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67e613b26bd43b936ce1b39425f48edd150c451485456357989e5a684be3d996","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T08:31:50.218574Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24665/citation-record","integrity":"/paper/2607.24665/integrity","json":"/paper/2607.24665/citation-record.json","paper":"/paper/2607.24665"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:49.474751Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:49.474751Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:bc464c5f06fec8908c9b7adc917a5bdc954f8c61e6e3e70e57828ab652a44ea3","observation_id":"cac886b2-b803-45b6-86ab-744b7f9e7600","resolution":{"observed_at":"2026-07-31T08:31:49.474751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:49.634754Z","title":"GShard: Scaling giant models with condi- tional computation and automatic sharding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:49.634754Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:61b50998d7e3af099a02453b3ebcf0ab8bf426928b3e469488e215c06eda4ed5","observation_id":"87484d0d-b587-4cbf-9063-5e92a3e662e8","resolution":{"observed_at":"2026-07-31T08:31:49.634754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:49.735178Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:49.735178Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:0138a69d25017c13e9e7711c9f1c17ed9ba37ff4ff3ccf1605338b59e7407928","observation_id":"0c09a726-ada1-4fa8-94d4-76243040c9c6","resolution":{"observed_at":"2026-07-31T08:31:49.735178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:49.884281Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:49.884281Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:5b6c8390c430c3067fe61f829c9b7a930ef000cf15547f8f9d555bad6270afc3","observation_id":"c776fa79-3278-4220-a270-c7d8019b358b","resolution":{"observed_at":"2026-07-31T08:31:49.884281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:49.984719Z","title":"MoE++: Accelerating mixture- of-experts methods with zero-computation experts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:49.984719Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:584edca2d5172afadc38fead06bc5135581f16c865453c208305ebc3992302d6","observation_id":"0e32dc96-cba9-46b1-af87-75f70c6be119","resolution":{"observed_at":"2026-07-31T08:31:49.984719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.055005Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.055005Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:91428f84c7c8e706866157c108673c48cfaabe98579d9c703a96a5db9ffdac82","observation_id":"ea96a5c2-a79b-4177-bae1-e702c95316cc","resolution":{"observed_at":"2026-07-31T08:31:50.055005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.099852Z","title":"SiT: Exploring flow and diffusion-based generative models with scalable interpolant transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.099852Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:d59ee26d0ff6b260ce1d309889d18b20257ce09acb33273b436d53c4011591fb","observation_id":"ede4df91-bf68-4ac4-8ade-6706415b619f","resolution":{"observed_at":"2026-07-31T08:31:50.099852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.102981Z","title":"Scaling diffusion transformers to 16 billion parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.102981Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:136fda010468e1e7980113ed45a2c540cf6b3c9d6db4530f2c87e2aa3911a7c5","observation_id":"77f8e3c0-37ae-46ff-b119-7e8ad458bff0","resolution":{"observed_at":"2026-07-31T08:31:50.102981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.105382Z","title":"EC-DIT: Scaling diffusion transformers with adaptive expert- choice routing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.105382Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:409bbb4869748dfc5ad3a787c9eb4faadddf99d43f5f2278bdd0f7ab11b67c4d","observation_id":"a7b7ab65-0ec1-420e-b844-e0443d7ff505","resolution":{"observed_at":"2026-07-31T08:31:50.105382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.107838Z","title":"Diff-MoE: Diffusion transformer with time-aware and space- adaptive experts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.107838Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:b8dde0b57625f56505101eecabb97cf375d918f6eb60eedbe408e134dc382662","observation_id":"0f5d69f8-161b-472d-94c6-ead09a5274b7","resolution":{"observed_at":"2026-07-31T08:31:50.107838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.110148Z","title":"Expert race: A flexible routing strategy for scaling diffusion transformer with mixture of experts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.110148Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:657616561c54bc299464a813dd6c941a2fd83069eedbaae84c110f70d425ad53","observation_id":"ba2ad4d9-0d69-457e-845b-072275aba873","resolution":{"observed_at":"2026-07-31T08:31:50.110148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.113263Z","title":"Routing matters in MoE: Scaling diffusion transformers with explicit routing guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.113263Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:0aa74c7f9c0116765c2e8292d9c0bb65085dcd03c908202ec66d65adfc660884","observation_id":"9fae13e8-ff2f-4e55-8820-cfade210a970","resolution":{"observed_at":"2026-07-31T08:31:50.113263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.115653Z","title":"Efficient training of diffusion mixture-of-experts models: A practical recipe,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.115653Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:0e1d6a818a909867e4c78f77005c9e884cab2260bdd3c5ce78a04cffdffccd2b","observation_id":"61ad410b-29e6-40bf-b19e-13f883e5ec89","resolution":{"observed_at":"2026-07-31T08:31:50.115653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.118583Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.118583Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:db813f07a5f38800b3e1c33cba28fc4f1ea3d06d2bba5edfaa95da31744c4097","observation_id":"1f1863a4-2832-4e71-94ae-61f39b04eb6a","resolution":{"observed_at":"2026-07-31T08:31:50.118583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.121016Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.121016Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:371691e453cfb80ef8ac01cf06be8ff6cbe8be8cf188d4e437bf32c59bc1b0e0","observation_id":"8026867e-5492-4165-966b-0138ab758421","resolution":{"observed_at":"2026-07-31T08:31:50.121016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.123579Z","title":"Score-based generative modeling through stochastic differen- tial equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.123579Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:a194705e137660b3a549f1a519eb6893f9e18211f0eb48af4c239014be9616e9","observation_id":"867b26c8-a4b2-4929-8989-9f21a6aba9ab","resolution":{"observed_at":"2026-07-31T08:31:50.123579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.126246Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.126246Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:e747942a797c2a5b1de89832be1b1b80378d89eff322b7a10ee48a8e4a9a73f9","observation_id":"adb3c9d2-ed17-4e7b-a8da-1b6f5a441a4b","resolution":{"observed_at":"2026-07-31T08:31:50.126246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.128957Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.128957Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:97bfb4f76512d6dabe0c05b8c8283609083e0740365aa3ea77e69a2dcb5589a9","observation_id":"98fbb7d2-13cc-46e6-8a24-28bd66a23062","resolution":{"observed_at":"2026-07-31T08:31:50.128957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.131644Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.131644Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:b1e640a0b36936fb5e5a74bc7737088c54360f2dcf601bc5ca58dd7c51e8f6bf","observation_id":"4d50817c-09d3-4d27-bd08-f89de2317b18","resolution":{"observed_at":"2026-07-31T08:31:50.131644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.134769Z","title":"Stochastic in- terpolants: A unifying framework for flows and diffusions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.134769Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:cda6a69b1722d8061257a953c1c2a6ac1a13eaeed9b8f636463df064f35aec55","observation_id":"fb90e865-d2bc-4cfe-a93b-52798ccdc781","resolution":{"observed_at":"2026-07-31T08:31:50.134769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.137436Z","title":"All are worth words: A ViT backbone for diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.137436Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:863c415fb192b0010088f90708795a7f7145f2ddee076b1ab0c19d60efa322be","observation_id":"26eb75c1-39d5-4b5e-a671-04c7edaa1c17","resolution":{"observed_at":"2026-07-31T08:31:50.137436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.140011Z","title":"Representation alignment for generation: Training diffusion transform- ers is easier than you think,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.140011Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:30168e2c972636e7d4a9c7250754e8a6dc9534442ba5f7bcbb04b5ef6f26daf8","observation_id":"3aabbf3d-c6d9-4310-ba69-c8b67b8ea567","resolution":{"observed_at":"2026-07-31T08:31:50.140011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20644","last_updated":"2025-03-26T15:37:17Z","snapshot_observed_at":"2026-08-14T01:02:28.952264Z","submitted_at":"2025-03-26T15:37:17Z","title":"MMGen: Unified Multi-modal Image Generation and Understanding in One Go","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20644","snapshot_observed_at":"2026-07-31T08:31:50.142918Z","title":"Mmgen: Unified multi-modal image generation and understanding in one go,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.142918Z"},"links":{"cited_paper":"/paper/2503.20644","citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:7283cc9fa2ab76b8b38022f9a97fa6316db2dd5ec9b1030549d3e0b18197d7fd","observation_id":"b9a71ed7-efba-496f-bfd5-792cbdb5e584","resolution":{"observed_at":"2026-07-31T08:31:50.142918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.146023Z","title":"Omnivdiff: Omni controllable video diffusion for generation and understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.146023Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:0d5db4ffe842135378cd0943f47bae43e6494d22f6fb54c8d74f90ec9b02797c","observation_id":"476d6aae-665c-4ca2-8e70-23e6ff06ae20","resolution":{"observed_at":"2026-07-31T08:31:50.146023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.148561Z","title":"Ctrlvdiff: Controllable video generation via unified multimodal video diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.148561Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:0530c846dae6da6cae6e80b386d253274de13e77a0c85b1fddfa76b02a02691d","observation_id":"9c17d106-8f2b-4f30-a92e-69e57cc79e99","resolution":{"observed_at":"2026-07-31T08:31:50.148561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09378","last_updated":"2026-05-10T07:03:37Z","snapshot_observed_at":"2026-08-15T14:11:23.559234Z","submitted_at":"2026-05-10T07:03:37Z","title":"EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09378","snapshot_observed_at":"2026-07-31T08:31:50.151717Z","title":"Edustory: A unified framework for pedagogically-consistent multi-shot stem instructional video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.151717Z"},"links":{"cited_paper":"/paper/2605.09378","citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:35d74abdf552aafc3a86411c29e020641774cda168023f2e5d1509bf6c428b6a","observation_id":"c951180d-226b-46c7-8171-df2fe4ce47a8","resolution":{"observed_at":"2026-07-31T08:31:50.151717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.154738Z","title":"Nero: Neural geometry and brdf reconstruction of reflective objects from multiview images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.154738Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:93e6490f09ff6dbbd8ee27df30a61e1ea8c8c329ab1f7729c2ab9568fab844ee","observation_id":"4ea8a7fa-4622-4438-ab4c-efc5bd958818","resolution":{"observed_at":"2026-07-31T08:31:50.154738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.157439Z","title":"Uni-retrieval: A multi-style retrieval framework for stem’s education,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.157439Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:ef58a38667a70338106d56b70c213ee060d256f2fed88f5922b6f4e0583b698e","observation_id":"830bd369-e7bd-4f70-b6c3-658650ede3a5","resolution":{"observed_at":"2026-07-31T08:31:50.157439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03868","last_updated":"2025-07-05T02:44:38Z","snapshot_observed_at":"2026-08-14T23:00:18.063549Z","submitted_at":"2025-07-05T02:44:38Z","title":"From Query to Explanation: Uni-RAG for Multi-Modal Retrieval-Augmented Learning in STEM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03868","snapshot_observed_at":"2026-07-31T08:31:50.159880Z","title":"From query to explanation: Uni-rag for multi-modal retrieval-augmented learning in stem,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.159880Z"},"links":{"cited_paper":"/paper/2507.03868","citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:4b4d3e1c459d7ce52b6f46c03505da5bc2454373873605f9add434d61ebc3445","observation_id":"8db100f9-5090-4edb-bfff-60fe0583e92f","resolution":{"observed_at":"2026-07-31T08:31:50.159880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.162671Z","title":"Towards affective evaluation of stem education: Leveraging mllms in project- based learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.162671Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:6a6b9d8636a2a6c5dbc4a1147c59ce9f689830e3ef54d197e4452cfd15d57d35","observation_id":"b73ed423-ea98-4386-91eb-b0a554babb21","resolution":{"observed_at":"2026-07-31T08:31:50.162671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.165160Z","title":"Seeing sound, hearing sight: Uncovering modality bias and conflict of ai mod- els in sound localization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.165160Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:5fd39181087306c4b8d6f8944ab2ff70e8bf3f69ade8e98d4267625d19c0088e","observation_id":"dfd9c4e9-93d2-450e-a438-7edccdc88337","resolution":{"observed_at":"2026-07-31T08:31:50.165160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.167530Z","title":"Senticnet 9: Generative commonsense for emotion ai via conceptual primitive discovery and time shift mechanism,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.167530Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:48ab3f2e24b15a60fdccb07dd14687cdad11793a1a375f24e693a8e01a7580b9","observation_id":"7aa41146-f5ca-413b-a5e8-6b35eca25bbb","resolution":{"observed_at":"2026-07-31T08:31:50.167530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.170275Z","title":"Towards spatial reasoning and understanding via modeling modality conflict, bias and alignment,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.170275Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:3eaeae3d55adbb8eae64b4b25702c7577ef023e2b3a3c2f679ff92102da1d024","observation_id":"961aab8f-4f2f-4ffa-bacd-77b9475bbdb8","resolution":{"observed_at":"2026-07-31T08:31:50.170275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.172753Z","title":"GLaM: Efficient scaling of language models with mixture-of- experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.172753Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:50076226885cc1283d0feb40802ddd213eb9fef0149a905871d70810afeb7f6d","observation_id":"c6f452a0-3651-49f2-ab9c-b4fac617807a","resolution":{"observed_at":"2026-07-31T08:31:50.172753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.175261Z","title":"ST-MoE: Designing stable and transferable sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.175261Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:0aa4f769da95c6bbe45e43e293ef747eea41d7f62a523fdef4085e1d8f5ddb50","observation_id":"381e6964-a82c-47b5-bc75-bedf222f9f3c","resolution":{"observed_at":"2026-07-31T08:31:50.175261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.177902Z","title":"DeepSeekMoE: Towards ultimate expert specialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.177902Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:9e39544216829ae989b367faa75ffb300e6945fe21fad152c3671968cef8a762","observation_id":"1372507a-5e74-4141-8abe-57bd7d4b2326","resolution":{"observed_at":"2026-07-31T08:31:50.177902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.180539Z","title":"Mixture-of-experts with expert choice routing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.180539Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:4f2a529a3b5ce8715e6e49254017d8d34cefc93f7cfcc70a4f7546e748b0fc11","observation_id":"75244cc6-1314-41a9-8274-fb778fd41c48","resolution":{"observed_at":"2026-07-31T08:31:50.180539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.183092Z","title":"DeepSeek-V3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.183092Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:e1dae5a8022876f9939c9772c2d9e9ecc2d3dc5b4e3aaadf83e0467bd2c2b3ba","observation_id":"07d32d52-388b-459f-8990-0cc9f0071b75","resolution":{"observed_at":"2026-07-31T08:31:50.183092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.186205Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.186205Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:a4f65f835fb538730c2c26041e87f6f9ac4850e3e66ccee99a257fc927cbef59","observation_id":"a297ac64-6110-41e4-ac3e-078013def1cd","resolution":{"observed_at":"2026-07-31T08:31:50.186205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.189000Z","title":"Scaling vision with sparse mixture of experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.189000Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:aa972994d06361c5aca9a3a7014b40e413705c43bfe23b5b738e42497f4edcd7","observation_id":"4540b41f-4ab7-46b6-a406-24a783daa3a7","resolution":{"observed_at":"2026-07-31T08:31:50.189000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.191648Z","title":"Attention residuals,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.191648Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:a7811bd944b1e08a47ff994a9595defc38dd381f4c16ce98283ef52480faf13b","observation_id":"145d86c5-5d8a-4e5f-acdb-e3410cdd4771","resolution":{"observed_at":"2026-07-31T08:31:50.191648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22932","last_updated":"2026-07-30T04:30:09Z","snapshot_observed_at":"2026-08-03T23:54:33.489447Z","submitted_at":"2026-06-22T07:08:31Z","title":"FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22932","snapshot_observed_at":"2026-07-31T08:31:50.194536Z","title":"Forge: Fused on-register gradient elimination for memory-efficient llm training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.194536Z"},"links":{"cited_paper":"/paper/2606.22932","citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:a0da2a205f108559e3c28c29fc9ac3f933f1bc9bd6dcab025395d58b20a4364b","observation_id":"01859a1e-52bc-4c83-8e18-295f77c8d43e","resolution":{"observed_at":"2026-07-31T08:31:50.194536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.197823Z","title":"DiffMoE: Dynamic token selection for scalable diffusion transformers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.197823Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:b3fbf3c80c526b968be661b4d4ac9f6da6cd888e11c1cd686b020c838a351e11","observation_id":"85f63cb6-3783-4d42-a05e-331ddf3cce29","resolution":{"observed_at":"2026-07-31T08:31:50.197823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.200386Z","title":"Ai flow at the network edge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.200386Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:1605c8fb49c16f44af9ac6d532d3ca3ad5f5d78c8f16656abdf4e41c00a2b445","observation_id":"a8587c8a-ee5d-4b79-a9b2-fe1ae8a8ae4f","resolution":{"observed_at":"2026-07-31T08:31:50.200386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.203232Z","title":"Ai flow: Perspectives, scenarios, and approaches,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.203232Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:518b23015b50d689fb9e37ba21d37e58c2f29f647be434c8afdc24b5c2c31123","observation_id":"506bfa3f-155c-4cf6-b5dd-d59d0a057f70","resolution":{"observed_at":"2026-07-31T08:31:50.203232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.205791Z","title":"Genera- tive transmission: Rethinking computation, bandwidth, and memory in communication,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.205791Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:285bbda075e62183918141d29505c24e1931d613a468ce755c1b37bb1b3d7a01","observation_id":"b3b72938-9870-45c1-bc7f-37ee28770b40","resolution":{"observed_at":"2026-07-31T08:31:50.205791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.208310Z","title":"ImageNet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.208310Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:ee3d26fbb01d669f6b887dd0cc04e480aa2d06167ee34e62cc33d5ed6037581f","observation_id":"093fc216-7f31-46bd-b1df-da4975419e66","resolution":{"observed_at":"2026-07-31T08:31:50.208310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.210728Z","title":"GANs trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.210728Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:406028f78eb1e5c5b083fe1e42b4e02dc83ca41f9366eddcb07d2b4e25715f95","observation_id":"4d6c98ca-8365-4c08-a561-a9ee508b5473","resolution":{"observed_at":"2026-07-31T08:31:50.210728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.213462Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.213462Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:fda199986d99ecbb17c55c0be2f805bd8de2f6f8eb178951d4e45c3e152aa8ff","observation_id":"07c601ca-f772-4402-b2bc-f28efc0d652b","resolution":{"observed_at":"2026-07-31T08:31:50.213462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.216000Z","title":"Dynamic diffusion transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.216000Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:bea3203069165d94ea688434cfe69871ed1a0e8c107e43630396f240f53803bf","observation_id":"24b07bd6-4884-4ad5-848d-10cdd554cf90","resolution":{"observed_at":"2026-07-31T08:31:50.216000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:31:50.218574Z","title":"Back to basics: Let denoising generative models denoise,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T08:31:50.218574Z"},"links":{"citing_paper":"/paper/2607.24665"},"observation_digest":"sha256:d7c1d51d8ef99cabc0e9708036bca479784c5cb52df19e1f87646bede7ff4c07","observation_id":"2f5c1595-312f-42eb-b5d6-0e2b70350cc3","resolution":{"observed_at":"2026-07-31T08:31:50.218574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24665","last_updated":"2026-07-27T17:05:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:12:00.424998Z","submitted_at":"2026-07-27T17:05:04Z","title":"MMOE: Modernizing Diffusion Transformers with Efficient Expert Design"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.24665."}