{"as_of":"2026-08-06T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b77a337f3a08273f2a29f9f1fd5ca1cced4e25362522cf8e8a5585f806d88f52","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T17:10:06.053994Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:57:24.835167Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T19:08:50.009027Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00069","snapshot_observed_at":"2026-08-04T17:57:24.835167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10377","last_updated":"2025-09-12T16:09:39Z","snapshot_observed_at":"2026-08-05T12:09:01.164266Z","submitted_at":"2025-09-12T16:09:39Z","title":"Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:24.835167Z"},"links":{"cited_paper":"/paper/2412.00069","citing_paper":"/paper/2509.10377"},"observation_digest":"sha256:eb99540622c38dcd9a46889de50aba53ae3adf6dbe364cd46ccc68ff2134a8ee","observation_id":"18dc9542-dbe7-4ce0-8934-929aa1388199","resolution":{"observed_at":"2026-08-04T17:57:24.835167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"cited_work":{"arxiv_id":"2412.00069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00069","snapshot_observed_at":"2026-07-03T19:08:50.009027Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","venue":"cs.LG","work_id":"c2957532-1dd3-4904-8346-8c5feed7bf6c","year":2024},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T03:34:10.370956Z"},"links":{"cited_paper":"/paper/2412.00069","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:ad8a5370d7414164f5123a454d3463980cbf30281419754564614efa881fbab9","observation_id":"f0be290f-5b62-4234-98ea-3b637cc799e3","resolution":{"observed_at":"2026-05-12T07:16:28.304287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"cited_work":{"arxiv_id":"2412.00069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00069","snapshot_observed_at":"2026-07-03T19:08:50.009027Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","venue":"cs.LG","work_id":"c2957532-1dd3-4904-8346-8c5feed7bf6c","year":2024},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-20T23:22:51.808346Z"},"links":{"cited_paper":"/paper/2412.00069","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:cafcef4d27a2bee0360cd9a6f40baf060f57d26841cbcc2aeebca3a7afd438b6","observation_id":"d2ed94a2-b269-46d3-8b39-92b5e0a141c2","resolution":{"observed_at":"2026-05-20T23:23:51.298416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"cited_work":{"arxiv_id":"2412.00069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00069","snapshot_observed_at":"2026-07-03T19:08:50.009027Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","venue":"cs.LG","work_id":"c2957532-1dd3-4904-8346-8c5feed7bf6c","year":2024},"citing_paper":{"arxiv_id":"2606.18304","last_updated":"2026-06-16T06:53:27Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T06:53:27Z","title":"Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T02:07:44.237002Z"},"links":{"cited_paper":"/paper/2412.00069","citing_paper":"/paper/2606.18304"},"observation_digest":"sha256:2f4e85eed7ecc413713c639632a87ddd0cf42922912e32a60606a27284108319","observation_id":"9df1c44c-300f-4802-81ca-96544e1cb952","resolution":{"observed_at":"2026-07-03T19:08:50.010625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00069/citation-record","integrity":"/paper/2412.00069/integrity","json":"/paper/2412.00069/citation-record.json","paper":"/paper/2412.00069"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T15:21:13.256394Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"f969ad36-6879-4127-aa9a-2fab0f2ec82b","year":null},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:cd4f2961ae39fb238cad24836c41ba12318b37a83a2734cecde1c6cb676faf3a","observation_id":"1bfee1b7-e09c-4e9f-8a57-5da39b558201","resolution":{"observed_at":"2026-05-23T17:13:14.783007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:0c34aeb1d586e531d19d269bdaeaf827a413105232ac334a300608dd742a294c","observation_id":"629ae37f-0382-4f68-86be-c5b6eca4dba7","resolution":{"observed_at":"2026-05-23T17:13:14.778469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07461","last_updated":"2024-10-09T22:00:19Z","snapshot_observed_at":"2026-08-01T15:13:45.909163Z","submitted_at":"2024-10-09T22:00:19Z","title":"Is C4 Dataset Optimal for Pruning? An Investigation of Calibration Data for LLM Pruning","version":1},"cited_work":{"arxiv_id":"2410.07461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07461","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is C4 dataset optimal for pruning? an investigation of calibration data for LLM pruning","venue":null,"work_id":"17817164-032c-4aa8-968b-2fa0add026c6","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2410.07461","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:15027eb248c7b06d618a460c2a0783cf7ede5a7d81ba708c0791536924bb66a0","observation_id":"b7b3971b-1360-49f3-8fd6-00c87a768ecf","resolution":{"observed_at":"2026-05-23T17:13:14.033346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-07-06T08:40:06.727297Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":"1911.11641","doi":"10.48550/arxiv.1911.11641","metadata_source":"pith","pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":"cs.CL","work_id":"0d865a62-6376-4606-8d3a-eeb3b6e9ba6d","year":2019},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:a53a79dd14c0ad7cf229694e45f9b352f261051f82a6f129faed0856543db879","observation_id":"5775df9f-cc60-46ad-9773-c7063d682187","resolution":{"observed_at":"2026-05-23T17:13:14.011725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:48e55bfbd9b92946194833f805939f85db6e07d465096f75fbaa06017616a3eb","observation_id":"82243946-d683-4d19-a99f-a519ac27db4c","resolution":{"observed_at":"2026-05-23T17:13:14.006001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09179","last_updated":"2022-10-12T10:17:55Z","snapshot_observed_at":"2026-07-06T13:01:51.959430Z","submitted_at":"2022-04-20T01:40:19Z","title":"On the Representation Collapse of Sparse Mixture of Experts","version":3},"cited_work":{"arxiv_id":"2204.09179","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.09179","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":"ec13e8c4-9d56-4c38-8766-bb8ac348a077","year":2022},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2204.09179","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:c03c503e25b3dd2d822e6e82d406478182d10c78791cf7e2fce8b3e1dc55493e","observation_id":"0a1cbc44-3106-48d0-85a1-a9eaeac23c38","resolution":{"observed_at":"2026-05-23T17:13:13.984927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:d33af27deeaf0452ea7ab1304ed6d53e46b6c745dfae6ae604480dee2a13b65e","observation_id":"3599cab2-ef44-4b9f-b81a-d2fa199364e6","resolution":{"observed_at":"2026-05-23T17:13:13.970101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":"1906.04341","doi":"10.48550/arxiv.1906.04341","metadata_source":"pith","pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","venue":"cs.CL","work_id":"88041fb5-b526-48f2-b4f5-57830c6b339d","year":2019},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:4838742fa7aea782c95d2e79accec699ef1248a3ddcb02f85f554f538f62aa39","observation_id":"298e93b6-69da-4da7-aada-9b2769b04896","resolution":{"observed_at":"2026-05-23T17:13:13.965186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:d25d6f94490d10054ec2fab49f1764418326ef9f1a86a8b59e7ceed4a06ec22f","observation_id":"2730f84b-4d4e-4cc9-9c46-f03c0a5b3e62","resolution":{"observed_at":"2026-05-23T17:13:13.959900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c849734c-9fc1-46b9-8034-9f83b24cf10f","year":2005},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:bf45144fa787da1b553b480f8545c6898013cb7d47eacf7dda9f5c21e9f3b75e","observation_id":"024e36e9-0a8d-4ff5-a655-948ae0d0f318","resolution":{"observed_at":"2026-05-23T17:13:14.746102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:f99a5f00d409a752637add9c20c5987354d20117f715b9ed6f34befe3f4b631a","observation_id":"2706ab21-131a-4f18-a019-536c991f1d89","resolution":{"observed_at":"2026-05-23T17:13:13.954661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":"2101.03961","doi":"10.1214/18-ejs1395","metadata_source":"pith","pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":"cs.LG","work_id":"f43c4955-a965-4897-a11b-c4b25d2aeaa8","year":2021},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:b715721119ff47f284617827a6d136071efe51ad9eb792e6992939b3b7370762","observation_id":"0cea8f76-6e54-44e3-9152-c09242596965","resolution":{"observed_at":"2026-05-23T17:13:13.949472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00774","last_updated":"2023-03-22T12:33:46Z","snapshot_observed_at":"2026-08-01T14:54:18.258666Z","submitted_at":"2023-01-02T17:48:56Z","title":"SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot","version":3},"cited_work":{"arxiv_id":"2301.00774","doi":"10.48550/arxiv.2301.00774","metadata_source":"pith","pith_arxiv_id":"2301.00774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":"cs.LG","work_id":"c299c96a-ab17-4fd6-9c67-201f8d8f1138","year":2023},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2301.00774","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:e9ea4b15769206de515e1b33a92cd9bc0b859d34988d641ec19d3ff57d17715d","observation_id":"c20041f7-2814-4d7a-a00f-082766b5aaab","resolution":{"observed_at":"2026-05-23T17:13:14.093060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:aa36241909ef63a5f2d57ec4685364701e52372868df605ebac8ed8139f04b19","observation_id":"c7e12475-2415-4237-acdd-b1e0d65b3126","resolution":{"observed_at":"2026-05-23T17:13:14.087374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.12608602","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:45.648157Z","title":"doi:10.5281/zenodo.12608602 , url =","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"2c57f331-c45e-4b28-9887-1931db7da39f","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:786d0d5ea8792eba4be231436c18bb64f11748f3be51e4815d964f516b209273","observation_id":"52bf1a05-0d58-46a7-98c3-f04bfc081d82","resolution":{"observed_at":"2026-05-23T17:13:13.052078Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02500","last_updated":"2025-03-17T14:18:42Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:18:40Z","title":"Towards Efficient Mixture of Experts: A Holistic Study of Compression Techniques","version":3},"cited_work":{"arxiv_id":"2406.02500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02500","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"org/CorpusID:270869609","venue":null,"work_id":"f67f42bc-6faa-4d16-b389-e1026cf5a2af","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2406.02500","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:0c4c0ff0a8320744047ae3b18aa07d3a791ed18b78ecc7fd7c19f3ca60420b31","observation_id":"e460339f-0b03-4481-8c6c-db2f56d117ed","resolution":{"observed_at":"2026-05-23T17:13:14.082298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:e86bdf26d531ee6a36d5ac541419122a237797d551e7b8f931ae33cbb2b44cf4","observation_id":"2127e1e0-0b63-4d8d-b359-fa32575e8e5b","resolution":{"observed_at":"2026-05-23T17:13:14.076876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b80490ba-5a17-4a7d-8089-c21254c0fe77","year":1975},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:da77975ad7741d9eb27d74f3d16fa99b1ceed47efc9360f0d356875cbb6aaea1","observation_id":"3f9f30ca-0b34-46f8-8fb8-0cea359169e7","resolution":{"observed_at":"2026-05-23T17:13:14.773689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:b230b641f69b0574e35edddf7b575534fb0fcfd504da9897ab7b8f99a452daf6","observation_id":"409468ee-fd0e-4376-99ff-1b0b81110a8c","resolution":{"observed_at":"2026-05-23T17:13:14.071380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18380","last_updated":"2025-06-09T03:55:25Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:22:22Z","title":"Outlier-weighed Layerwise Sampling for LLM Fine-tuning","version":3},"cited_work":{"arxiv_id":"2405.18380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18380","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fcd697d6-2766-4f67-8941-621f78da465d","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2405.18380","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:ce97efff0c0b4b2a2b85b01eebbf70ba025c05dc95f6013ef3784426dc4d1f93","observation_id":"e564d970-dbf3-4644-9b2a-799ee8102dbd","resolution":{"observed_at":"2026-05-23T17:13:14.066690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:2b235939021290f74bab0a217de03b09209699aa853cfa0a0cc1d78cd80da062","observation_id":"04cc05ad-d4f1-40d2-a50f-9be1250037d4","resolution":{"observed_at":"2026-05-23T17:13:14.061601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08276","last_updated":"2019-01-24T08:20:42Z","snapshot_observed_at":"2026-07-06T07:28:43.161359Z","submitted_at":"2019-01-24T08:20:42Z","title":"Traditional and Heavy-Tailed Self Regularization in Neural Network Models","version":1},"cited_work":{"arxiv_id":"1901.08276","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.08276","snapshot_observed_at":"2026-07-04T02:59:25.669161Z","title":"Traditional and Heavy-Tailed Self Regularization in Neural Network Models","venue":"cs.LG","work_id":"9b7bf9ee-a70a-4276-be72-6a823a0329d6","year":2019},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1901.08276","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:94f0700bcacabec03060d39f40ab7fae99278811aed120be5361c69a884cf980","observation_id":"c57a42e8-79da-488c-afc3-b1fd019f1c3c","resolution":{"observed_at":"2026-05-23T17:13:14.055892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0cce87d1-23c2-4b44-8cca-aba6c0b4cbcb","year":2020},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:6cc1a824833a90dbb04bc27c44e46d65af33d8042b1eef3b987feb31023673dc","observation_id":"83e9f3d4-3413-4501-9f80-28dfd8f76307","resolution":{"observed_at":"2026-05-23T17:13:14.770173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4dcecf8b-71db-4244-b20f-5239bea5b727","year":2021},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:979f1979a95fd90ae742a628b71896678afaeed6dd17c46abbb84669a463bb19","observation_id":"959f6f8a-87b6-4515-9ec8-e0c2686d8cef","resolution":{"observed_at":"2026-05-23T17:13:14.766720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":"2403.03853","doi":"10.48550/arxiv.2403.03853","metadata_source":"pith","pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":"cs.CL","work_id":"195a45aa-5b87-4058-97eb-f08eca8ee8c6","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:7e74f6ffcb96e0f54a8976d804e6b5ba2bef62aa7ba8537abb6567f63cacdafc","observation_id":"20b208f8-95a3-418f-88ae-3d2b4b5da2c3","resolution":{"observed_at":"2026-05-23T17:13:14.050878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1260","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"642f5867-b098-4ec2-9fd0-c6dd37388412","year":2018},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:21ea69d42b4871503434e11ea8cc5f967f5cdf7e210fcf9b74dc954e99c2c3eb","observation_id":"59bf7a80-8e88-4dfb-af07-d0f450005285","resolution":{"observed_at":"2026-05-23T17:13:13.057419Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-17T19:51:13.783624+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T19:51:13.783624+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05089","last_updated":"2024-04-07T22:13:43Z","snapshot_observed_at":"2026-08-02T10:32:35.474061Z","submitted_at":"2024-04-07T22:13:43Z","title":"SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2404.05089","doi":"10.48550/arxiv.2404.05089","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/CorpusID:268253470","venue":"arXiv (Cornell University)","work_id":"99e526d7-ce14-4c4c-96a1-6942f7908390","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2404.05089","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:0d5f3c48ebd22d163625470ccb1c0ecfa60240b1d04af2300bcc28fa4d2935dd","observation_id":"a89d51e7-941f-408c-b4ca-ff6c2c19a190","resolution":{"observed_at":"2026-05-23T17:13:14.044860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":"2108.12409","doi":"10.48550/arxiv.2108.12409","metadata_source":"pith","pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":"cs.CL","work_id":"145b1374-5258-4c00-a433-4db0f5a50749","year":2021},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:56548c91c2e4634baca6e29efcb41878e2aa871d357429d320c8f57aa302bb07","observation_id":"d15489b9-0f3f-4194-b92a-ea7218fe9dd1","resolution":{"observed_at":"2026-05-23T17:13:14.038990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":"1907.10641","doi":"10.48550/arxiv.1907.10641","metadata_source":"pith","pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":"cs.CL","work_id":"9587a902-54ad-434e-9cbc-bdfe54b5d3bf","year":2019},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:2828a69e2478ad06029917db9b94dd5bf555c431308bbbd6224a7ac03bae1f0a","observation_id":"09903d7b-c265-4199-945b-f279f7455c1f","resolution":{"observed_at":"2026-05-23T17:13:14.017414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bae222e3-2238-42c9-9121-a13ca7225311","year":2020},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:992cb58f3a9048d84d418d427876acf2fb47da3bdb4027be1584d96d076f01d2","observation_id":"599f18fb-168d-4a0c-8bb7-226cdbfa9f41","resolution":{"observed_at":"2026-05-23T17:13:14.763462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:dc0f617f70ef60541a6e409b61531a29a1bf48f096482e592b5da22124167b75","observation_id":"4ade4778-53d0-4c0f-acf7-dd7093edecc5","resolution":{"observed_at":"2026-05-23T17:13:14.022452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05216","last_updated":"2023-04-11T13:34:13Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T13:34:13Z","title":"Towards Efficient Fine-tuning of Pre-trained Code Models: An Experimental Study and Beyond","version":1},"cited_work":{"arxiv_id":"2304.05216","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05216","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e77e5e7b-0238-46dc-9995-3046a749f388","year":2023},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2304.05216","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:5ac6081600d9e0b18f8fd2a3adedfee0966d105a1d5008bc07baebcfab63f8e7","observation_id":"d6d6dec2-e449-437d-8f1c-5ac61e79c4bd","resolution":{"observed_at":"2026-05-23T17:13:14.027533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.11695","doi":"10.48550/arxiv.2306.11695","metadata_source":"pith","pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Simple and Effective Pruning Approach for Large Language Models","venue":"cs.CL","work_id":"e764df7f-c928-4b41-812e-352750f475c2","year":2023},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:ea21f525e4548e75c24bbc66d3e0d63442069fed318be371477030d6f8f7c292","observation_id":"b1deffd0-36ce-45a4-9e63-ec6f89a356e2","resolution":{"observed_at":"2026-05-23T17:13:13.979634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f5d16b5f-7465-4ea6-a10d-a9406293c99f","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:7629ea4a58b8fb7e469cc6e5ecc16dc0014da0a86b1cdf8aa4c0d609fff39521","observation_id":"fe6525c8-165f-49d4-baae-ee1f87057391","resolution":{"observed_at":"2026-05-23T17:13:14.759957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a18db7b-1274-4fc9-bc9b-14e9e38b9b66","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:5e28e73e05b6e24e0f31656fa67f7554e9fdbaf71987b884e70dc3251d779bb7","observation_id":"f446fd88-ff78-4848-86ec-4a7d7fdf8a00","resolution":{"observed_at":"2026-05-23T17:13:14.756395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:c1e6ea228903c8743d8d2c214cd07070a6f90bce57f0cc92bbcc2632b5d3b478","observation_id":"a005d7cd-b5b6-4c2c-bf27-c0a4b1c39292","resolution":{"observed_at":"2026-05-23T17:13:13.974881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6fff81f-4a46-4272-be19-b0dc61f0da5d","year":2023},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:68428b259285cf58e86d09e6df3828ad3a43ab8cea42f2fd036d7188389b402e","observation_id":"64784ab2-8d62-4d22-aea7-200d7d8c17dd","resolution":{"observed_at":"2026-05-23T17:13:14.752842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65b4bb6e-8525-420c-afb5-4cd21412743c","year":2023},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:ed4845ddb76e4b3aff24b8ba58aaa16407869337b5325beebc92fa712c0c5fba","observation_id":"c3741258-d969-41f9-bb86-9c0da7e6646f","resolution":{"observed_at":"2026-05-23T17:13:14.749296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:fe6531f4567bd375188f2f5dc231a9ea4b93d0bfaf7b1cde11ebe31dfbda710b","observation_id":"fe1faf90-3339-4ef4-aeea-2519e289f5dd","resolution":{"observed_at":"2026-05-23T17:13:14.000037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:24b6b893ead8f7b907a8863950eaabf9b368dde97b346bb0b1ad03d7a9f957ef","observation_id":"455d5464-fabf-4953-84e9-97f33299eacf","resolution":{"observed_at":"2026-05-23T17:13:13.990072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18218","last_updated":"2024-10-20T09:10:25Z","snapshot_observed_at":"2026-08-06T18:43:32.229808Z","submitted_at":"2024-05-28T14:21:15Z","title":"FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.18218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18218","snapshot_observed_at":"2026-07-10T12:07:03.684455Z","title":"FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models","venue":"cs.LG","work_id":"9916430b-6a14-499f-bf78-592ea79e1b8d","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2405.18218","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:77f72164491be292dd1a4d7aa62ed5219ad3ea5965a7644d206a840ec37c1793","observation_id":"88f66b36-7342-49c0-b134-63282d68760c","resolution":{"observed_at":"2026-05-23T17:13:13.994866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":29,"verified_fuzzy":2},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 4 inbound Pith citation observations for arXiv:2412.00069."}