{"as_of":"2026-08-15T00:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d09478e18a00cd854aec15d8d9621f2dca0a4c80d623dac8ff45247192ec36a8","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:12:46.187984Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20875/citation-record","integrity":"/paper/2412.20875/integrity","json":"/paper/2412.20875/citation-record.json","paper":"/paper/2412.20875"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-10T23:12:46.087752Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.087752Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:0082c4337b3baff826ae6ef960444b9c3fd611d2e95b9e748855b800b33008f0","observation_id":"02e9d718-36b9-4932-8269-6b1409f99352","resolution":{"observed_at":"2026-08-10T23:12:46.087752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.587770Z","title":"(2022)) to column first in order to aggregate row wise scores efficiently","venue":null,"work_id":"1488d62c-85bc-4ee6-9771-ca500ea38e0f","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.180286Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:d7b1468d816fea5aaf70b73b77266431b3b76e40ce5140872bb3a72c22d67307","observation_id":"088ba14c-0a2b-403d-ba18-419097171c2d","resolution":{"observed_at":"2026-08-10T23:12:46.593375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.644505Z","title":"Jordan and R.A","venue":null,"work_id":"1521bee9-ed41-413d-a15a-b5ed12e58743","year":1993},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.129681Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:97ab4949fe57765cb67fa4b54b8dd1193c7913832856958a0081c2c7c247155d","observation_id":"00862e64-3b68-48fd-9e4b-379e188947fa","resolution":{"observed_at":"2026-08-10T23:12:46.649562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T23:12:46.138122Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.138122Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:96acfded8d7e8fee49d076b8c017a866424afc963e63e02bd825b0d45102ffc1","observation_id":"87190a05-b759-4a1d-9708-0390f408b66a","resolution":{"observed_at":"2026-08-10T23:12:46.138122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-10T23:12:46.146643Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.146643Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:4f896925c4ef02d9decc52966625ae2210c688a641eee951c0a1626c40cdc5e3","observation_id":"2a86ddda-136d-499a-83cb-3a31e445ab19","resolution":{"observed_at":"2026-08-10T23:12:46.146643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.150934Z","title":"Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis, Quoc Le, Geoffrey Hinton, and Jeff Dean","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.150934Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:cc206f080448c1f964dd9341d7051853470a0aadaef69816c20e5de1c6fb0c87","observation_id":"6704a57f-4422-4318-894b-8b0789abcc2b","resolution":{"observed_at":"2026-08-10T23:12:46.150934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05558","last_updated":"2022-07-27T17:26:18Z","snapshot_observed_at":"2026-08-14T20:40:27.981488Z","submitted_at":"2020-07-10T18:26:17Z","title":"The Computational Limits of Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05558","snapshot_observed_at":"2026-08-10T23:12:46.154905Z","title":"The computational limits of deep learning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.154905Z"},"links":{"cited_paper":"/paper/2007.05558","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:e427fd64130894c8afacc10d35f5000fb090943938cfa3ab43d5988fac857fca","observation_id":"27bebf00-eb55-43b2-9abf-4073af15dfb4","resolution":{"observed_at":"2026-08-10T23:12:46.154905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14458","last_updated":"2024-10-30T01:49:34Z","snapshot_observed_at":"2026-08-12T23:59:58.018406Z","submitted_at":"2024-05-23T11:44:29Z","title":"YOLOv10: Real-Time End-to-End Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14458","snapshot_observed_at":"2026-08-10T23:12:46.159112Z","title":"Yolov10: Real-time end-to-end object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.159112Z"},"links":{"cited_paper":"/paper/2405.14458","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:bfbfb95d948eaf1c83e039d31e2f73deec8cb2ce7302573e326b646d9cd44fb4","observation_id":"99890f0c-8a5d-4db2-97d2-f5375c338f5c","resolution":{"observed_at":"2026-08-10T23:12:46.159112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-10T23:12:46.163154Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.163154Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:d74759e9c6059a932ac2ac30eb64ec5f2b4acfbfb0e98046a919cf85b4407702","observation_id":"3da45293-e846-4a9e-a604-09ac8a17a533","resolution":{"observed_at":"2026-08-10T23:12:46.163154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.560310Z","title":"Algorithm 1 A-MoD with Flash Attention, modified from Algorithm 1 in Dao et al","venue":null,"work_id":"4d98d154-864a-4894-b128-0a35e604488a","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.187984Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:a24ea9eaf5eba1ab9435437a8deb8044a7384df8d1fa998f0bac165adae15625","observation_id":"134746bd-5b84-4a9d-8c10-c378edd381e7","resolution":{"observed_at":"2026-08-10T23:12:46.566158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.616460Z","title":"Fine- tuning with A-MoD: Results comparing A-MoD with standard routing and isoFLOP baselines for 12.5% capacity on ImageNet-1k","venue":null,"work_id":"1e888a49-e24c-4a51-94d9-4420df16c2ea","year":2015},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.171424Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:818ed6087e774fd0d833cd23519b5cfcc9fdcb62359b446f9ade6e16cb515b04","observation_id":"020580f2-c3a5-408a-bb1c-a200fb483b4a","resolution":{"observed_at":"2026-08-10T23:12:46.621253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.602469Z","title":null,"venue":null,"work_id":"dc175030-b115-402e-965c-1ff3ee9288e1","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.176046Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:9d6f65596dc6325a2aae2a1fc388e714b9242dadcf37d2ea9ac2524888210a02","observation_id":"c350d607-1bcf-4e6b-8f02-80b0ee826065","resolution":{"observed_at":"2026-08-10T23:12:46.607502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.575638Z","title":"We compare with the baseline results provided in Table 11 in Bolya et al","venue":null,"work_id":"4abb035b-6605-4c30-819f-329c4abb0b1a","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.184163Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:08e3eb419d966e33a3a2f9e35ebad62d9fb215fdc42ffd096aa9966ee8fcc1d8","observation_id":"abce2d01-e0ec-404e-a0b9-2cab9df573f2","resolution":{"observed_at":"2026-08-10T23:12:46.579883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19985","last_updated":"2024-07-30T17:26:22Z","snapshot_observed_at":"2026-08-12T23:12:53.105235Z","submitted_at":"2024-07-29T13:19:31Z","title":"Mixture of Nested Experts: Adaptive Processing of Visual Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19985","snapshot_observed_at":"2026-08-10T23:12:46.121178Z","title":"Mixture of nested experts: Adaptive processing of visual tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.121178Z"},"links":{"cited_paper":"/paper/2407.19985","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:a8c5d125aba3d75e7c7b2ef1630fefad6158fcc0c8500c7b374d836802797f3c","observation_id":"9c40a882-05a8-4aad-ae4a-64124aa97d76","resolution":{"observed_at":"2026-08-10T23:12:46.121178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.134066Z","title":"Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.134066Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:f327ebf4adeaf2fcd5bbc8a15d9e764b5e17880dee8ffac0be93d8caa95113d9","observation_id":"8253f738-8fa0-4bf4-bb50-462bad4cf955","resolution":{"observed_at":"2026-08-10T23:12:46.134066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-14T07:20:22.540923Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-10T23:12:46.102638Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.102638Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:18136cf0a86126e6f6942c4297f5e18af0566ff99ff036fd91c009e177e3eb74","observation_id":"ed50a281-0131-40d9-ae4c-89e9872549e7","resolution":{"observed_at":"2026-08-10T23:12:46.102638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06297","last_updated":"2016-01-07T22:41:10Z","snapshot_observed_at":"2026-08-14T22:22:10.782232Z","submitted_at":"2015-11-19T18:40:22Z","title":"Conditional Computation in Neural Networks for faster models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06297","snapshot_observed_at":"2026-08-10T23:12:46.093201Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.093201Z"},"links":{"cited_paper":"/paper/1511.06297","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:4db951222441c7c37c683369e7dd5495bde6f0af82ffe7de1c58014058392c89","observation_id":"10aa2906-3976-4f60-96de-d1435e10a95b","resolution":{"observed_at":"2026-08-10T23:12:46.093201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-10T23:12:46.098087Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.098087Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:b8ba487a90d595b6f2b9fcc25a2e91cfb0c7fea970397f86abb953c61c1b59b9","observation_id":"b6685bac-5984-48f2-b2bf-608fa9348939","resolution":{"observed_at":"2026-08-10T23:12:46.098087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T23:12:46.116329Z","title":"Train- ing compute-optimal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.116329Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:9475a29a2a6afbf59ec55ed7c4bcc7e1d56351e2fca232b52d7fc848b05d1be2","observation_id":"d639b5f7-ce2e-46e4-8a0a-740caa441742","resolution":{"observed_at":"2026-08-10T23:12:46.116329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.630640Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":"4597777c-dc1a-4b63-b6a8-2e36d992f2f1","year":2024},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.142501Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:24ddab426774f85a6e41a9f5d7b4bfabd0addede2ec0db6999aae0e33ba6861a","observation_id":"348de185-fa69-4036-bd7f-3795ac587e3c","resolution":{"observed_at":"2026-08-10T23:12:46.635097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T23:12:46.125395Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.125395Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:cfb652dcb5957dccfabafd0db023fe0dd90795fcd207e81467abcdc40fa80524","observation_id":"01e2d03d-8dd9-49af-ad4d-cb50e9fd82c5","resolution":{"observed_at":"2026-08-10T23:12:46.125395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-14T11:01:09.094119Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-10T23:12:46.111458Z","title":"William Fedus, Jeff Dean, and Barret Zoph","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.111458Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:defcf64152fcb5cbde14970b04b77d2e8ba17053ab3279632f398a905629ee94","observation_id":"f5cdce41-7bdf-4b43-9721-f538f0b5ae2e","resolution":{"observed_at":"2026-08-10T23:12:46.111458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-10T23:12:46.167415Z","title":"ST-MoE: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.167415Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:b5e3b206f04beaf755091ed5de1618366a9adf24f8e5abd960a224aa7d229ce6","observation_id":"ce6f1959-a86d-44eb-9857-b58a40be3fa6","resolution":{"observed_at":"2026-08-10T23:12:46.167415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.657847Z","title":"On the benefits of learning to route in mixture-of-experts models","venue":null,"work_id":"b26e8c9b-7ee1-4eb8-814c-75e7a560e984","year":2023},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.107011Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:45cf1b331295ce70c63211e3adc891f5363b7c56e93a4cea065b2c8457c6e193","observation_id":"7464dd74-b32d-4f9b-860b-c31d48d3842a","resolution":{"observed_at":"2026-08-10T23:12:46.662404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T19:21:50.130034Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2412.20875."}