{"as_of":"2026-08-07T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:286a07d3da46a1b895a0886e461e8072aa14227f8f479ff59b5a3443629d5aeb","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:23.210297Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17909/citation-record","integrity":"/paper/2505.17909/integrity","json":"/paper/2505.17909/citation-record.json","paper":"/paper/2505.17909"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.04248","last_updated":"2022-03-08T18:06:26Z","snapshot_observed_at":"2026-08-05T02:18:34.028943Z","submitted_at":"2022-03-08T18:06:26Z","title":"Dual Lottery Ticket Hypothesis","version":1},"cited_work":{"arxiv_id":"2203.04248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.04248","snapshot_observed_at":"2026-08-07T14:44:27.877526Z","title":"Dual Lottery Ticket Hypothesis","venue":"cs.LG","work_id":"fe708beb-4b68-44db-8016-c6417a4840d1","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:11.919090Z"},"links":{"cited_paper":"/paper/2203.04248","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:cd63fc8a17f9b4a817961e4fe11cb4a10f942b6be2397f9cfd8a1123123931ce","observation_id":"66e5f206-e71b-461c-81a9-e02c56b8cf40","resolution":{"observed_at":"2026-08-07T14:44:27.957516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05136","last_updated":"2018-08-07T18:12:10Z","snapshot_observed_at":"2026-08-02T08:20:39.795411Z","submitted_at":"2017-11-14T15:02:47Z","title":"Deep Rewiring: Training very sparse deep networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05136","snapshot_observed_at":"2026-08-07T14:44:12.035710Z","title":"Deep Rewiring: Training very sparse deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.035710Z"},"links":{"cited_paper":"/paper/1711.05136","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b5b0e5d7ae44929195ce7fa121740dc32901e37dd28dbd0d3dfc3bcca7aecf74","observation_id":"5193e021-c86b-4be2-8e41-7df1064721d2","resolution":{"observed_at":"2026-08-07T14:44:12.035710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/bimj.4710230408","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.468730Z","title":null,"venue":null,"work_id":"455884a3-693e-45a8-8b24-4e50027634fd","year":1981},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.138159Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:25765582fe98169d9012d8700f4a4a8f1aa835a6c425ba2e99440aabf386efcb","observation_id":"09bb27e9-9ff0-450b-b125-008ed0bc1832","resolution":{"observed_at":"2026-08-07T14:44:23.514478Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09824","last_updated":"2021-12-18T02:26:38Z","snapshot_observed_at":"2026-07-06T12:20:09.242116Z","submitted_at":"2021-12-18T02:26:38Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09824","snapshot_observed_at":"2026-08-07T14:44:12.236606Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.236606Z"},"links":{"cited_paper":"/paper/2112.09824","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:73b8dc85a6b45253b4072ce58093f07beb71526859ee5182010d9fe1b9da9d57","observation_id":"75416058-9ad1-46d7-a048-191eec4ce2c3","resolution":{"observed_at":"2026-08-07T14:44:12.236606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-07-06T08:40:06.727297Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T14:44:12.329681Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.329681Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1bd593796e32c58a3310424d4f826771eb52f6f76ac550b289565c8c13a51203","observation_id":"e2e254e4-b893-42af-85eb-46e08bb5e66d","resolution":{"observed_at":"2026-08-07T14:44:12.329681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:12.426680Z","title":"Bagging predictors","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.426680Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:c533ac32f8fd6d5f89845dac68af648b1468df9516375a58a0d651ff76fc1c98","observation_id":"98e0d66b-7034-4165-84f6-fdfc12fe95fd","resolution":{"observed_at":"2026-08-07T14:44:12.426680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:12.542409Z","title":"Sparsity Made Easy – Introducing the Cerebras PyTorch Sparsity Library - Cerebras , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.542409Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:3365705a5dcb1713b67b221b951249ce318036f1b0fbc23473302e0cf1431b90","observation_id":"eb3149ad-85d8-473e-af6e-42eda8ffd709","resolution":{"observed_at":"2026-08-07T14:44:12.542409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T14:44:12.608543Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.608543Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:98feaa9ac1902ea9e9d1569320de41e8c3bcb2ca50326302650db8a8c5e22e5c","observation_id":"43462b01-4665-4a7a-8025-1233e03edb06","resolution":{"observed_at":"2026-08-07T14:44:12.608543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:44:12.707447Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.707447Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:6352b5e18d6ccd4dd669f660f27afb36aea5d230ec13d9d8339eb710adf0cb0f","observation_id":"6227da71-17c8-497e-92ae-51d6ef28cd4a","resolution":{"observed_at":"2026-08-07T14:44:12.707447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01732","last_updated":"2022-07-12T09:29:49Z","snapshot_observed_at":"2026-08-06T11:43:45.083762Z","submitted_at":"2021-02-02T20:06:47Z","title":"Truly Sparse Neural Networks at Scale","version":2},"cited_work":{"arxiv_id":"2102.01732","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.01732","snapshot_observed_at":"2026-08-07T14:44:27.638678Z","title":"Truly Sparse Neural Networks at Scale","venue":"cs.LG","work_id":"bcd15f67-0783-4e7c-a760-ba72330ad7ab","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.769776Z"},"links":{"cited_paper":"/paper/2102.01732","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:880633f7ffe76a6d5396268dc5a64a8a52a1e5b4fa6478c39f4be3fc5a659122","observation_id":"347dcfd5-2bc6-4ada-994e-c4e3e02bf2c2","resolution":{"observed_at":"2026-08-07T14:44:27.740776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:12.870321Z","title":"ImageNet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.870321Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e1f46b87f53c1d2ec1c79692dbee4eda1a063bca949c9debc170848a901bbaea","observation_id":"9e422ca2-d494-4951-85de-e46cbbe87926","resolution":{"observed_at":"2026-08-07T14:44:12.870321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04840","last_updated":"2019-08-23T18:30:16Z","snapshot_observed_at":"2026-07-06T08:06:52.501752Z","submitted_at":"2019-07-10T17:40:20Z","title":"Sparse Networks from Scratch: Faster Training without Losing Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04840","snapshot_observed_at":"2026-08-07T14:44:12.949488Z","title":"Sparse Networks from Scratch: Faster Training without Losing Performance , 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.949488Z"},"links":{"cited_paper":"/paper/1907.04840","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:053df9cadfdb16530d5b1d23800f09822abdc74453db884343505f3077c54a38","observation_id":"61f28856-7849-4afc-b622-6ef12bb32ca3","resolution":{"observed_at":"2026-08-07T14:44:12.949488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:13.057748Z","title":"Dietterich","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.057748Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:cabb8096b959158c632c6f92bb3c76c353f5c745c00e8ca1287417f5cf3814b9","observation_id":"69f99ec9-8bbd-4c3e-8c1b-16e8cab6e461","resolution":{"observed_at":"2026-08-07T14:44:13.057748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11134","last_updated":"2021-07-23T14:12:42Z","snapshot_observed_at":"2026-07-06T08:39:52.703032Z","submitted_at":"2019-11-25T18:58:53Z","title":"Rigging the Lottery: Making All Tickets Winners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11134","snapshot_observed_at":"2026-08-07T14:44:13.153977Z","title":"Rigging the Lottery: Making All Tickets Winners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.153977Z"},"links":{"cited_paper":"/paper/1911.11134","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2112827fccaad5fa6e432ebc97ff45d7f0d1fb4e76ad40e6406699eab51c4706","observation_id":"732ef82f-9c5f-4133-9b06-b1c498aca163","resolution":{"observed_at":"2026-08-07T14:44:13.153977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03533","last_updated":"2022-03-16T00:14:20Z","snapshot_observed_at":"2026-08-04T17:31:24.906588Z","submitted_at":"2020-10-07T17:26:08Z","title":"Gradient Flow in Sparse Neural Networks and How Lottery Tickets Win","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03533","snapshot_observed_at":"2026-08-07T14:44:13.271860Z","title":"Gradient flow in sparse Neural Networks and how Lottery Tickets win","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.271860Z"},"links":{"cited_paper":"/paper/2010.03533","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:298170993733366947367ffb9265256cd8eb954a71e0390f537484812d6b85fb","observation_id":"2c4f52e5-71e6-465e-a7bf-3064e9da51b5","resolution":{"observed_at":"2026-08-07T14:44:13.271860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-07T14:44:13.467858Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.467858Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d4a4d7f04caa1791c43440b43b39c6fe50ed8c68b12d861bb40f6a7f7bf702ec","observation_id":"cbcecc6d-9459-41bf-8d81-96545c2aba95","resolution":{"observed_at":"2026-08-07T14:44:13.467858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02757","last_updated":"2020-06-25T03:57:04Z","snapshot_observed_at":"2026-08-02T23:41:42.474354Z","submitted_at":"2019-12-05T17:48:18Z","title":"Deep Ensembles: A Loss Landscape Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02757","snapshot_observed_at":"2026-08-07T14:44:13.632238Z","title":"Deep Ensembles: A Loss Landscape Perspective , 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.632238Z"},"links":{"cited_paper":"/paper/1912.02757","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e8f8b2e9c2a631173f0055bedf13d1f8770b794cdf5f2eb7a2204b6da80e310c","observation_id":"a5ca5e0a-a4d4-4818-b051-271d96a6202d","resolution":{"observed_at":"2026-08-07T14:44:13.632238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-07T14:44:13.869088Z","title":"The Lottery Ticket Hypothesis: Training Pruned Neural Networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.869088Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ef60d537373b0fe03b88f9e4f4557a3163c610f4b08435d0bb4aed0086b90c39","observation_id":"bd4e18b1-ff3b-450d-99f3-c9fae7dac3cd","resolution":{"observed_at":"2026-08-07T14:44:13.869088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.079669Z","title":"A Decision-Theoretic Generalization of On-Line Learning and an Application to Boosting","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.079669Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:88752e211ac9a64b0f22162c927b43078996b72598a77df475eadbd258832f9d","observation_id":"bbcf884e-369e-42cc-912d-342783d1c755","resolution":{"observed_at":"2026-08-07T14:44:14.079669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.301408Z","title":"A Survey on Ensemble Learning for Data Stream Classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.301408Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:354604b75bdd431eccbe442fdf10be378ccd540703d75749abc89b92c403af4f","observation_id":"7894540d-135f-4d5a-94ee-2b26184e4965","resolution":{"observed_at":"2026-08-07T14:44:14.301408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10369","last_updated":"2022-06-17T14:08:00Z","snapshot_observed_at":"2026-07-06T13:23:04.941974Z","submitted_at":"2022-06-17T14:08:00Z","title":"The State of Sparse Training in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2206.10369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.10369","snapshot_observed_at":"2026-08-07T14:44:27.313373Z","title":"The State of Sparse Training in Deep Reinforcement Learning","venue":"cs.LG","work_id":"9d7b4045-4411-4189-901b-94a7253c6164","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.421338Z"},"links":{"cited_paper":"/paper/2206.10369","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a1d9fcd05590fbc454d7992b01043b3087b3bb0c488b5b8f7af3d71526dd9c36","observation_id":"d249c34a-a4fd-4e4e-a578-5aff4c29bf8f","resolution":{"observed_at":"2026-08-07T14:44:27.385114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06548","last_updated":"2023-02-13T17:45:03Z","snapshot_observed_at":"2026-07-06T14:51:22.788392Z","submitted_at":"2023-02-13T17:45:03Z","title":"Automatic Noise Filtering with Dynamic Sparse Training in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2302.06548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.06548","snapshot_observed_at":"2026-08-07T14:44:27.088313Z","title":"Automatic Noise Filtering with Dynamic Sparse Training in Deep Reinforcement Learning","venue":"cs.LG","work_id":"258d90ff-7cc0-43e2-b427-e2e6e5bf28d7","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.586279Z"},"links":{"cited_paper":"/paper/2302.06548","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b328c300198df4a950e49e78d02500c81630c573e055eaa479703dcac2bbd4a7","observation_id":"e0e5c620-8dcf-4eda-9a30-1a7cf1bebb03","resolution":{"observed_at":"2026-08-07T14:44:27.194418Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.769213Z","title":"On Calibration of Modern Neural Networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.769213Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:92c950b098b2990e249c2b9067c26ebe638fac8ef6537708871bf72ac84494f0","observation_id":"4dee6fdf-9bc8-46d0-8036-f76255f032fd","resolution":{"observed_at":"2026-08-07T14:44:14.769213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02626","last_updated":"2015-10-30T23:29:27Z","snapshot_observed_at":"2026-07-06T04:20:15.965140Z","submitted_at":"2015-06-08T19:28:43Z","title":"Learning both Weights and Connections for Efficient Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02626","snapshot_observed_at":"2026-08-07T14:44:14.934609Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.934609Z"},"links":{"cited_paper":"/paper/1506.02626","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7a412c89686389b1b98c6ca60c4a859abad8ce28cbc88bfdb3c061639dd63c90","observation_id":"42a12602-f844-407b-8860-81bbffcb3db0","resolution":{"observed_at":"2026-08-07T14:44:14.934609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:15.133429Z","title":"Neural Network Ensembles","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.133429Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7f637c841df25668784d4dfd686d75ac9d45e8d0e5c470d1f1cda6ad1660bbbf","observation_id":"f66e33af-f58c-45a1-8041-0852bbf8ab92","resolution":{"observed_at":"2026-08-07T14:44:15.133429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:15.312715Z","title":"The Elements of Statistical Learning","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.312715Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1447ebc61ec1377ef8bd665df16ecf786c785e027842d2a958aac72532cde387","observation_id":"1cd3eb80-6b6d-419b-88ae-a847d889d8b4","resolution":{"observed_at":"2026-08-07T14:44:15.312715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06610","last_updated":"2021-08-04T23:30:03Z","snapshot_observed_at":"2026-08-02T18:06:38.478187Z","submitted_at":"2020-10-13T18:05:13Z","title":"Training independent subnetworks for robust prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.06610","snapshot_observed_at":"2026-08-07T14:44:15.519215Z","title":"Training independent subnetworks for robust prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.519215Z"},"links":{"cited_paper":"/paper/2010.06610","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:50b63dfc51381c604966b8f343f04216a90ff95ecc5310dd13aa3547bc4dc427","observation_id":"9c6085fc-c066-4d71-b85a-31f4fb9a9c93","resolution":{"observed_at":"2026-08-07T14:44:15.519215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-07T14:44:15.623137Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.623137Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:69663e4674a992a3a6a3ae451dde7e60e0b92942dfcd7a14a4c05fe2f5c25dc1","observation_id":"2784e133-3518-43e1-be50-b71a84b7b959","resolution":{"observed_at":"2026-08-07T14:44:15.623137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-02T09:01:28.869881Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-07T14:44:15.789693Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.789693Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:8baaecf9e71cb56e5e5c92d341ad44e6384fcebcd6558fc6d740cf81f6666012","observation_id":"5773cf56-cb35-4333-baf9-842db34ad5f8","resolution":{"observed_at":"2026-08-07T14:44:15.789693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T14:44:16.005473Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.005473Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d1216f2d60ec13adc28a049c3c2d61659908c572591bcd3806fe66ad79021610","observation_id":"bbbe08d4-a64e-4431-95d0-b789630a9671","resolution":{"observed_at":"2026-08-07T14:44:16.005473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:44:16.198598Z","title":"Distilling the Knowledge in a Neural Network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.198598Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2d5ae7bb5f2ad50412ff6e9b2b641fa3e3e91807094a7759c1c2fe0ebc2f3253","observation_id":"440b9ba4-f062-466e-a86f-901ea0e1ac1c","resolution":{"observed_at":"2026-08-07T14:44:16.198598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:16.342941Z","title":"Jacobs, Michael I","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.342941Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:f80e3d45c315937fdd02b0b23ba09f65034fdc3c97641d11bdaeea40993c1367","observation_id":"b70f59c0-d8e2-4fcb-b744-7eba9775c5bd","resolution":{"observed_at":"2026-08-07T14:44:16.342941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11323","last_updated":"2023-10-31T12:01:36Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:07Z","title":"Joint Training of Deep Ensembles Fails Due to Learner Collusion","version":2},"cited_work":{"arxiv_id":"2301.11323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.11323","snapshot_observed_at":"2026-08-07T14:44:26.838872Z","title":"Joint Training of Deep Ensembles Fails Due to Learner Collusion","venue":"cs.LG","work_id":"02b09bc3-19f9-4531-8971-39820a303eb4","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.441859Z"},"links":{"cited_paper":"/paper/2301.11323","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:991c351b34b6597620b828c347753733b78d0c7b056ca6baf90e273b8334142f","observation_id":"dd4669ac-bfaa-477c-bfba-5cbc2f465524","resolution":{"observed_at":"2026-08-07T14:44:26.948514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:30.513499Z","title":"Mercer, Lalit R","venue":null,"work_id":"627dbc9d-8515-433e-b09f-0a0d35f861ca","year":1977},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.593230Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:de875eeb02cda301f8165b0f4cbbb27ffc2403b18b4b900054b78edebff9461c","observation_id":"f48f0d8e-226f-4f08-aa19-125d09ad7859","resolution":{"observed_at":"2026-08-07T14:44:30.585191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:44:16.753152Z","title":"Adam: A Method for Stochastic Optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.753152Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d672e46689431b15616415f587e8c78d282bdb7211edef06f02bd37e6dc2f61e","observation_id":"3127ba84-dcf5-4e3c-8d5b-c803230311a7","resolution":{"observed_at":"2026-08-07T14:44:16.753152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:30.369417Z","title":"Learning Multiple Layers of Features from Tiny Images","venue":null,"work_id":"d33b9055-e9f7-448e-9571-2e64db2c7fcb","year":2009},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.927446Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:f5c8423e2c99e78aa77c85ed98b8b73ee70fd8446ec9df702de423f3641a20a7","observation_id":"7cc5f1af-09cb-42ef-b42e-b9ff53c80b6d","resolution":{"observed_at":"2026-08-07T14:44:30.448192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.144681Z","title":"Kuncheva and Christopher J","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.144681Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:63c4ddb437cc3224a4db0296c26d884aba51b729cf269eaee718506ff40f91af","observation_id":"4812df5f-3a6a-4199-80cd-860853c6e09a","resolution":{"observed_at":"2026-08-07T14:44:17.144681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01474","last_updated":"2017-11-04T01:33:43Z","snapshot_observed_at":"2026-07-06T05:21:24.357721Z","submitted_at":"2016-12-05T18:54:43Z","title":"Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01474","snapshot_observed_at":"2026-08-07T14:44:17.305484Z","title":"Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.305484Z"},"links":{"cited_paper":"/paper/1612.01474","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:af003916986f4357e17151422f7f79f14174f85786e98f8769b4212a0718a69b","observation_id":"82ad0db2-4f3d-4b22-b234-b70a37b25ae9","resolution":{"observed_at":"2026-08-07T14:44:17.305484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:30.119894Z","title":null,"venue":null,"work_id":"d28b5225-036d-4de1-82ba-4aeafb3cd43f","year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.527410Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:67e88d22906a5a1a276d99394e71a93719ea8b671c18f4ff6d9f56d058cb3b4a","observation_id":"18acd9d6-b85a-477c-9591-78e6ada56074","resolution":{"observed_at":"2026-08-07T14:44:30.228382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.890316Z","title":"Optimal Brain Damage","venue":null,"work_id":"2475067b-5a42-4663-af77-607e33741aee","year":1989},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.708917Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9377298da1cc87d8c0cec709e8fa148e1ae8fc507def63cfdab1716c1900079b","observation_id":"f78425ac-28b6-4bfb-bb44-05e5bd1f1859","resolution":{"observed_at":"2026-08-07T14:44:30.005151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02301","last_updated":"2025-01-29T13:27:37Z","snapshot_observed_at":"2026-08-06T12:19:34.743020Z","submitted_at":"2024-08-05T08:23:59Z","title":"Network Fission Ensembles for Low-Cost Self-Ensembles","version":2},"cited_work":{"arxiv_id":"2408.02301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02301","snapshot_observed_at":"2026-08-07T14:44:26.643444Z","title":"Network Fission Ensembles for Low-Cost Self-Ensembles","venue":"cs.CV","work_id":"466dac24-0cdd-45da-9a2e-0552b37db644","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.858613Z"},"links":{"cited_paper":"/paper/2408.02301","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9c93c30560e21a7cab6d7dbcec6bef7c58c05ff20c3d0c31f1b22e7f91be8822","observation_id":"4f89ff15-487a-4116-a9b3-3584301ab336","resolution":{"observed_at":"2026-08-07T14:44:26.730470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02340","last_updated":"2019-02-23T07:45:29Z","snapshot_observed_at":"2026-07-06T07:06:10.289386Z","submitted_at":"2018-10-04T17:39:58Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02340","snapshot_observed_at":"2026-08-07T14:44:18.076914Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.076914Z"},"links":{"cited_paper":"/paper/1810.02340","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:023e5ce513b54413b17294598f570381a445e74c79eeb29ec2552bc3c828bf70","observation_id":"edcfffd4-7652-4500-a4df-1d99501792d5","resolution":{"observed_at":"2026-08-07T14:44:18.076914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06314","last_updated":"2015-11-19T19:19:58Z","snapshot_observed_at":"2026-07-06T04:37:08.670695Z","submitted_at":"2015-11-19T19:19:58Z","title":"Why M Heads are Better than One: Training a Diverse Ensemble of Deep Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06314","snapshot_observed_at":"2026-08-07T14:44:18.243783Z","title":"Why M Heads are Better than One: Training a Diverse Ensemble of Deep Networks , 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.243783Z"},"links":{"cited_paper":"/paper/1511.06314","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:13590a2d70403e320b6f7078d70334981b7e8c64b8028494291f44a2cf4c2b62","observation_id":"0a0d4d28-85d6-4100-b22f-bb196873f680","resolution":{"observed_at":"2026-08-07T14:44:18.243783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13795","last_updated":"2025-08-04T10:49:54Z","snapshot_observed_at":"2026-08-05T13:37:28.213031Z","submitted_at":"2024-12-18T12:39:53Z","title":"Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13795","snapshot_observed_at":"2026-08-07T14:44:18.461312Z","title":"Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.461312Z"},"links":{"cited_paper":"/paper/2412.13795","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e91221ea0b4bb8a64285e09dbf101a0a14dd05b08e444f2779650564defc8400","observation_id":"6ce60a9a-7ba9-4126-bdf4-772657ddd940","resolution":{"observed_at":"2026-08-07T14:44:18.461312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00521-020-05136-7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.324819Z","title":"Sparse evolutionary deep learning with over one million artificial neurons on commodity hardware","venue":null,"work_id":"da50dc60-1e2d-46a3-a7ee-63b70bca2e67","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.616644Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ac1eafe96bab9fa77294c5ca8899bc341f13355d40cdd3be9b440da7a9d6937f","observation_id":"719d0591-8ec3-4721-8e02-4c0ffccc76ad","resolution":{"observed_at":"2026-08-07T14:44:23.355126Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02887","last_updated":"2021-06-15T05:01:46Z","snapshot_observed_at":"2026-07-06T10:38:38.546882Z","submitted_at":"2021-02-04T20:59:31Z","title":"Do We Actually Need Dense Over-Parameterization? In-Time Over-Parameterization in Sparse Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02887","snapshot_observed_at":"2026-08-07T14:44:18.767822Z","title":"Do We Actually Need Dense Over-Parameterization? In-Time Over-Parameterization in Sparse Training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.767822Z"},"links":{"cited_paper":"/paper/2102.02887","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a12f753dc1eced6ff93b0c12b28c6cd6de24e1270b32e43dcd54f02842512dd4","observation_id":"82285b37-8be4-4244-a883-9675835242b6","resolution":{"observed_at":"2026-08-07T14:44:18.767822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.984031Z","title":"Deep Ensembling with No Overhead for either Training or Testing: The All-Round Blessings of Dynamic Sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.984031Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:dd64ffb56325b596ba9f1557221f11a9a85910bdbb19330863222fc027649860","observation_id":"9685a34b-eabb-4197-afc9-2b1f044cc95f","resolution":{"observed_at":"2026-08-07T14:44:18.984031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02643","last_updated":"2022-02-05T21:19:41Z","snapshot_observed_at":"2026-07-06T12:34:47.800121Z","submitted_at":"2022-02-05T21:19:41Z","title":"The Unreasonable Effectiveness of Random Pruning: Return of the Most Naive Baseline for Sparse Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02643","snapshot_observed_at":"2026-08-07T14:44:19.129246Z","title":"The Unreasonable Effectiveness of Random Pruning: Return of the Most Naive Baseline for Sparse Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.129246Z"},"links":{"cited_paper":"/paper/2202.02643","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7a0c1e1917bdf5deea6ecc8939cda16d5bac1d420afa68ab3d1f5bd9b518be67","observation_id":"1fa92b7c-f112-4c2e-b429-afe41b7667f2","resolution":{"observed_at":"2026-08-07T14:44:19.129246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1106.0257","last_updated":"2011-06-01T16:41:44Z","snapshot_observed_at":"2026-08-07T11:52:49.941920Z","submitted_at":"2011-06-01T16:41:44Z","title":"Popular Ensemble Methods: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1106.0257","snapshot_observed_at":"2026-08-07T14:44:19.344085Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.344085Z"},"links":{"cited_paper":"/paper/1106.0257","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2066d8e0a291d5fb18c0dbb0398f8fc71ce9909e5dabdb523728cbd5980049c7","observation_id":"e4ce0165-5ab5-462f-b501-107392af1db9","resolution":{"observed_at":"2026-08-07T14:44:19.344085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T14:44:19.547695Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering , 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.547695Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:c17124de545b541a91c67f96200bc7f1b040d9369dce4548b28274c8b63c05b0","observation_id":"8cb67157-9dc8-4e13-a181-cd6a2d42a304","resolution":{"observed_at":"2026-08-07T14:44:19.547695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04780","last_updated":"2018-06-20T12:55:55Z","snapshot_observed_at":"2026-07-06T05:51:15.659938Z","submitted_at":"2017-07-15T19:46:25Z","title":"Scalable Training of Artificial Neural Networks with Adaptive Sparse Connectivity inspired by Network Science","version":2},"cited_work":{"arxiv_id":"1707.04780","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.04780","snapshot_observed_at":"2026-08-07T14:44:26.244350Z","title":"Scalable Training of Artificial Neural Networks with Adaptive Sparse Connectivity inspired by Network Science","venue":"cs.NE","work_id":"4811a325-63ee-4054-9985-80d47717af4f","year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.713861Z"},"links":{"cited_paper":"/paper/1707.04780","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:35f85dd407f3f4f63fcae2ae43316e3c316dfe2022e5650d9f4e2900837e296a","observation_id":"cd903a2c-20b0-4ab3-9c75-284ac6f5eb59","resolution":{"observed_at":"2026-08-07T14:44:26.358926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.660098Z","title":"Skeletonization: A Technique for Trimming the Fat from a Network via Relevance Assessment","venue":null,"work_id":"f5f2db56-0539-446b-bc55-6e83e8cd6616","year":1988},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.933039Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b8efe46e01d60879e0d5f22242b3c7061256bd38d193e06121b290916f16c401","observation_id":"1895e05d-c12e-4813-8d2b-1f52d7a9badb","resolution":{"observed_at":"2026-08-07T14:44:29.769200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.071092Z","title":"Obtaining Well Calibrated Probabilities Using Bayesian Binning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.071092Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:972792e415b1ac27ff3eebb1bf76fa894d2dcaef7397f132bf006519bed1d6e8","observation_id":"330b8e86-c430-4f92-90ff-734bb8247042","resolution":{"observed_at":"2026-08-07T14:44:20.071092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.387185Z","title":"DeepSparse Inference Engine , 2021","venue":null,"work_id":"73fb346d-029b-49f6-bd2c-4e4ef94ddc68","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.175525Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:de9189def3345008fd934d09c31bb6f4b9090d31623f4046469a5608abfb59c0","observation_id":"e994418e-410d-4d81-b697-afa0f2d65c6b","resolution":{"observed_at":"2026-08-07T14:44:29.514942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12230","last_updated":"2023-11-30T03:44:26Z","snapshot_observed_at":"2026-07-06T15:45:06.154616Z","submitted_at":"2023-06-21T12:43:55Z","title":"Fantastic Weights and How to Find Them: Where to Prune in Dynamic Sparse Training","version":2},"cited_work":{"arxiv_id":"2306.12230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.12230","snapshot_observed_at":"2026-08-07T14:44:25.934585Z","title":"Fantastic Weights and How to Find Them: Where to Prune in Dynamic Sparse Training","venue":"cs.LG","work_id":"199e08b4-c0d5-4e8f-a88f-b7a7c1438350","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.325435Z"},"links":{"cited_paper":"/paper/2306.12230","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9f180065b06b5efab4fdfb479ae34640cdd62fc620f90e2826fde196213b6ff8","observation_id":"1e3ca92d-eb0d-4d54-a43e-d547ff981e2a","resolution":{"observed_at":"2026-08-07T14:44:26.091130Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01755","last_updated":"2024-06-03T19:44:47Z","snapshot_observed_at":"2026-08-05T23:24:43.516263Z","submitted_at":"2024-06-03T19:44:47Z","title":"Sparser, Better, Deeper, Stronger: Improving Sparse Training with Exact Orthogonal Initialization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01755","snapshot_observed_at":"2026-08-07T14:44:20.425205Z","title":"Nowak, ukasz Gniecki, Filip Szatkowski, and Jacek Tabor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.425205Z"},"links":{"cited_paper":"/paper/2406.01755","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9b9cacae68870bf16551971d7300c9c7b8c3b7abe13538ec65071f3488785c96","observation_id":"8428e4be-13b1-422d-a74d-97c567c7e979","resolution":{"observed_at":"2026-08-07T14:44:20.425205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.090579Z","title":"ResNet50 v1.5 for PyTorch , 2024","venue":null,"work_id":"4b65c27f-56f0-49ad-add1-b295af15ba4f","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.561166Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a4b3225f409be6e014829a83faef535169fe75446f7b73ccadd1bbad834f3a3b","observation_id":"dedd5263-4b20-4db2-a735-4dbd747ce3d0","resolution":{"observed_at":"2026-08-07T14:44:29.252939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.893303Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":null,"work_id":"fd9cea35-030d-4841-bc7d-5e8059cd7482","year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.688213Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:fb8b429cd1f191a9f7c5062278a89c700f9fff37e01e94eaa2de306853dc5f65","observation_id":"597bad49-07e9-4373-9c4d-c407433fb53c","resolution":{"observed_at":"2026-08-07T14:44:29.008177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.706353Z","title":"A Stochastic Approximation Method","venue":null,"work_id":"0a2edc7b-6478-4450-ab79-d7c0cb4f12f8","year":1951},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.851505Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:26e2018bbcf044bd5cfcbff9ea67af6629df5895a3e6ad5408ad6a3391c48ada","observation_id":"af4eac31-2d55-4676-85d0-3698fcd72da4","resolution":{"observed_at":"2026-08-07T14:44:28.779551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-07T14:44:21.016796Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.016796Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d0317abfab5793ae532616f3d0a4dcb6df66f2d27d9229265e4b73e31a6d5f21","observation_id":"3d6e95a8-339c-4426-bc5a-d7d834dce895","resolution":{"observed_at":"2026-08-07T14:44:21.016796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03725","last_updated":"2023-06-06T14:44:52Z","snapshot_observed_at":"2026-07-06T15:39:14.565475Z","submitted_at":"2023-06-06T14:44:52Z","title":"Towards Memory-Efficient Training for Extremely Large Output Spaces -- Learning with 500k Labels on a Single Commodity GPU","version":1},"cited_work":{"arxiv_id":"2306.03725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03725","snapshot_observed_at":"2026-08-07T14:44:25.661475Z","title":"Towards Memory-Efficient Training for Extremely Large Output Spaces -- Learning with 500k Labels on a Single Commodity GPU","venue":"cs.LG","work_id":"999df040-da5a-4b05-b6f0-6d1d39c1eb01","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.148630Z"},"links":{"cited_paper":"/paper/2306.03725","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:5dc1cb1721a2ac80ca02521a52127faa98329f93629a025255eae16a1d923a25","observation_id":"9561ad24-354f-4081-a9a5-d15494df3ebf","resolution":{"observed_at":"2026-08-07T14:44:25.765932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.465042Z","title":null,"venue":null,"work_id":"7022b3bf-f53e-4984-83f9-0f5e8dac1376","year":1996},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.235606Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:68fc4dc0bf8357a2a800d0187600acc23c4e9bb5e6ba600b4fbee4c44656ab67","observation_id":"193ae81e-bd38-44a9-87b4-7858a2e693b8","resolution":{"observed_at":"2026-08-07T14:44:28.574747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04217","last_updated":"2022-05-05T18:37:44Z","snapshot_observed_at":"2026-07-06T11:17:02.238931Z","submitted_at":"2021-06-08T09:57:20Z","title":"Dynamic Sparse Training for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2106.04217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04217","snapshot_observed_at":"2026-08-07T14:44:25.391582Z","title":"Dynamic Sparse Training for Deep Reinforcement Learning","venue":"cs.LG","work_id":"9bf7a463-82e8-4e8a-ac10-38df39c00026","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.282780Z"},"links":{"cited_paper":"/paper/2106.04217","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:097fe8bc394d96207dc5e90123dc93ac286fd82111ef363ff0c2c6e2fa56c9aa","observation_id":"aeb0dcd4-9a5e-4e31-ab05-4bde6923adfc","resolution":{"observed_at":"2026-08-07T14:44:25.537900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15043","last_updated":"2023-03-08T08:47:23Z","snapshot_observed_at":"2026-07-06T13:15:24.934829Z","submitted_at":"2022-05-30T12:18:43Z","title":"RLx2: Training a Sparse Deep Reinforcement Learning Model from Scratch","version":2},"cited_work":{"arxiv_id":"2205.15043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.15043","snapshot_observed_at":"2026-08-07T14:44:25.041486Z","title":"RLx2: Training a Sparse Deep Reinforcement Learning Model from Scratch","venue":"cs.LG","work_id":"0db84869-c97e-4816-9fe2-6903efed8450","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.344571Z"},"links":{"cited_paper":"/paper/2205.15043","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:31e644b3ce0d89c216a9ccc1ac88e75843b1e14faa19a9c4738bf04821a145ee","observation_id":"082ecf70-70a8-4bef-9b68-6c286d644f3d","resolution":{"observed_at":"2026-08-07T14:44:25.215575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:44:21.435141Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.435141Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7f595f52aa54af44c0f9899ed472dd7eb21b5f326fddd2a29cabb2a709aec9fc","observation_id":"a06df54a-89cd-4602-842e-7f92ec4b5a76","resolution":{"observed_at":"2026-08-07T14:44:21.435141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0442.35604","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.802910Z","title":"Varrette, H","venue":null,"work_id":"030461da-220e-4949-b1cf-13e68fad5aa8","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.512080Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1fcdbb21ece4a36b1111b049f02f75fc63cc38659894d51751b639afb04c30ac","observation_id":"ecf70624-3590-4484-9d8e-9ebc63156483","resolution":{"observed_at":"2026-08-07T14:44:24.896840Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:44:21.615136Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.615136Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:44ec81f043dca04193f1ce4a7c83875f2c60577ea8c90b1b4dda5af0a3af8cf2","observation_id":"5ecbf571-2046-4e99-b746-fac13ed7595b","resolution":{"observed_at":"2026-08-07T14:44:21.615136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-03T13:48:05.558970Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-07T14:44:21.715735Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.715735Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:34b8575d2d2013fffc7922f8eee8e135848556bb270911f8d6e0502dfae099e0","observation_id":"609ad148-c3bc-42f5-9ba5-dd3c5f57f4aa","resolution":{"observed_at":"2026-08-07T14:44:21.715735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.274458Z","title":"Learning Robust Global Representations by Penalizing Local Predictive Power","venue":null,"work_id":"d11ec66d-d7ef-4977-a5ee-8ce06fb7cdad","year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.820170Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:bb5aacc4c7a029441b74398e9486e96ee85f2a2bbea38c51c6f8b0b8f51cf463","observation_id":"7b458f2c-16c2-49af-baee-fd168ae858dc","resolution":{"observed_at":"2026-08-07T14:44:28.359765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06715","last_updated":"2020-02-20T03:38:44Z","snapshot_observed_at":"2026-08-01T10:08:45.076962Z","submitted_at":"2020-02-17T00:00:59Z","title":"BatchEnsemble: An Alternative Approach to Efficient Ensemble and Lifelong Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06715","snapshot_observed_at":"2026-08-07T14:44:21.931636Z","title":"BatchEnsemble: An Alternative Approach to Efficient Ensemble and Lifelong Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.931636Z"},"links":{"cited_paper":"/paper/2002.06715","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:f744d1ecff1677775c3a66f4cfb06674de2fb5f55f09b65dd494a0cbb8f6aff3","observation_id":"254e1cb9-0974-45c5-9563-18fcb67add63","resolution":{"observed_at":"2026-08-07T14:44:21.931636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17437","last_updated":"2024-07-24T17:13:31Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:13:31Z","title":"Nerva: a Truly Sparse Implementation of Neural Networks","version":1},"cited_work":{"arxiv_id":"2407.17437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17437","snapshot_observed_at":"2026-08-07T14:44:24.527559Z","title":"Nerva: a Truly Sparse Implementation of Neural Networks","venue":"cs.LG","work_id":"21f9be36-0d8d-47e7-93f3-ed056e099379","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.019881Z"},"links":{"cited_paper":"/paper/2407.17437","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ffa644dc3bfb1ac1dfe963f012032db085060f22c4fdb281029e1e823385754e","observation_id":"7a0f6a7e-ca27-44cb-bf6b-4861c2f88367","resolution":{"observed_at":"2026-08-07T14:44:24.632843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11782","last_updated":"2022-03-25T17:15:40Z","snapshot_observed_at":"2026-07-06T12:41:03.022395Z","submitted_at":"2022-02-23T20:53:54Z","title":"Prune and Tune Ensembles: Low-Cost Ensemble Learning With Sparse Independent Subnetworks","version":2},"cited_work":{"arxiv_id":"2202.11782","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.11782","snapshot_observed_at":"2026-08-07T14:44:24.313384Z","title":"Prune and Tune Ensembles: Low-Cost Ensemble Learning With Sparse Independent Subnetworks","venue":"cs.LG","work_id":"f35f4759-d940-4185-b15b-07ff22cfa5d5","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.092097Z"},"links":{"cited_paper":"/paper/2202.11782","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:36961acdb8a15c505923a9267437cd56eeed38e58f5496a666dea3c108898169","observation_id":"80af6930-0542-4929-9201-1fa2278a87c8","resolution":{"observed_at":"2026-08-07T14:44:24.414672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T14:44:22.165258Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.165258Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:6fee877926c1d64f19fbbac21c3d05c9951a24d534bfd1041ad8cb854cf48cb8","observation_id":"a24298ac-d6d7-44a8-8833-586e4296502e","resolution":{"observed_at":"2026-08-07T14:44:22.165258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.101185Z","title":null,"venue":null,"work_id":"76376de9-53f3-4b98-b9f2-613d9151b989","year":1992},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.237158Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:c01564f72fe16659628ab8edde2258f9ab2744b44511f046e384f0b7ceb45e9c","observation_id":"7ee3a99d-23ef-40d2-b382-84c99634a2f6","resolution":{"observed_at":"2026-08-07T14:44:28.200572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03030","last_updated":"2025-03-05T04:37:07Z","snapshot_observed_at":"2026-08-05T08:35:38.742561Z","submitted_at":"2024-10-03T22:24:54Z","title":"Dynamic Sparse Training versus Dense Training: The Unexpected Winner in Image Corruption Robustness","version":2},"cited_work":{"arxiv_id":"2410.03030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03030","snapshot_observed_at":"2026-08-07T14:44:24.109402Z","title":"Dynamic Sparse Training versus Dense Training: The Unexpected Winner in Image Corruption Robustness","venue":"cs.CV","work_id":"f94fde97-fb9d-4d04-bb7c-e8af1405ffba","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.342479Z"},"links":{"cited_paper":"/paper/2410.03030","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1b1c4bc74b2f0b3473d9a0d742a1cd6bf36394a6256f3ddfb2faed8f1da1da27","observation_id":"a93aa535-4cb6-49d9-a8d2-eb4c852f792c","resolution":{"observed_at":"2026-08-07T14:44:24.210999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14831","last_updated":"2023-12-04T14:52:08Z","snapshot_observed_at":"2026-07-06T16:11:27.419669Z","submitted_at":"2023-08-28T18:31:09Z","title":"Continual Learning with Dynamic Sparse Training: Exploring Algorithms for Effective Model Updates","version":2},"cited_work":{"arxiv_id":"2308.14831","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14831","snapshot_observed_at":"2026-08-07T14:44:23.926066Z","title":"Continual Learning with Dynamic Sparse Training: Exploring Algorithms for Effective Model Updates","venue":"cs.LG","work_id":"d4d5e957-bbff-4a47-9fd7-47fff494b681","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.442515Z"},"links":{"cited_paper":"/paper/2308.14831","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ea4753d0684ed3ab0a87162c74a62dbb7fd3eb5e1db5a5b846c0b12da63f39dc","observation_id":"00c1b99f-a601-44c6-ae5a-b96b42b7662f","resolution":{"observed_at":"2026-08-07T14:44:23.992254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05175","last_updated":"2025-06-30T22:16:39Z","snapshot_observed_at":"2026-08-01T08:08:15.221032Z","submitted_at":"2023-10-08T14:22:58Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05175","snapshot_observed_at":"2026-08-07T14:44:22.533903Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.533903Z"},"links":{"cited_paper":"/paper/2310.05175","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a2880417bcbbde4fa16551f4df9143465ad3753e1fe7b894ac6de45b98b5bec7","observation_id":"83154707-d389-4e84-a03c-0e9a35a6b810","resolution":{"observed_at":"2026-08-07T14:44:22.533903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11957","last_updated":"2025-03-03T17:04:08Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:43:56Z","title":"Drawing Early-Bird Tickets: Towards More Efficient Training of Deep Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11957","snapshot_observed_at":"2026-08-07T14:44:22.610368Z","title":"Baraniuk, Zhangyang Wang, and Yingyan Lin","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.610368Z"},"links":{"cited_paper":"/paper/1909.11957","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:875cae18fbbae9c1bfadeb6263fa0b4f86e41cbb2d0b0ed60086c8dabf92406f","observation_id":"965697d7-2da6-4398-9ee5-3364f3fcd26c","resolution":{"observed_at":"2026-08-07T14:44:22.610368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14032","last_updated":"2021-10-26T21:15:17Z","snapshot_observed_at":"2026-07-06T12:02:19.650098Z","submitted_at":"2021-10-26T21:15:17Z","title":"MEST: Accurate and Fast Memory-Economic Sparse Training Framework on the Edge","version":1},"cited_work":{"arxiv_id":"2110.14032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.14032","snapshot_observed_at":"2026-08-07T14:44:23.736573Z","title":"MEST: Accurate and Fast Memory-Economic Sparse Training Framework on the Edge","venue":"cs.LG","work_id":"6d4ab535-e239-4aa8-918e-50854e6ccb8f","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.701532Z"},"links":{"cited_paper":"/paper/2110.14032","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2580535c007b488e2b3da222316c994e2c1c639737805a0c374ee293fcfb87e0","observation_id":"66b6f0d6-7a53-4bbd-aff4-509c9269ea76","resolution":{"observed_at":"2026-08-07T14:44:23.793230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07146","last_updated":"2017-06-14T06:06:48Z","snapshot_observed_at":"2026-08-01T16:47:50.594148Z","submitted_at":"2016-05-23T19:27:13Z","title":"Wide Residual Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07146","snapshot_observed_at":"2026-08-07T14:44:22.864692Z","title":"Wide Residual Networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.864692Z"},"links":{"cited_paper":"/paper/1605.07146","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1023cd9638feb0d1246247e936d16448adb6fe0ec6a36d7c47088fd49a291c17","observation_id":"ceba48ee-4491-4cff-9677-d2c3e4ec64ca","resolution":{"observed_at":"2026-08-07T14:44:22.864692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T14:44:23.014536Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence? Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.014536Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9873894a0e3dfcc84f39f41fd2318b2f58d6d7655a60d306b24496caa1ce1d13","observation_id":"3be92767-aab7-481d-9441-5efc1227d076","resolution":{"observed_at":"2026-08-07T14:44:23.014536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.115529Z","title":"Brain-inspired sparse training enables Transformers and LLMs to perform as fully connected","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.115529Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:04f37ec304fa735068b6039280d400f68e14a46a89fa0b7be4b0fe777dbc7606","observation_id":"7b2f1288-742e-4992-bcec-2ad267819673","resolution":{"observed_at":"2026-08-07T14:44:23.115529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T14:44:23.169462Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.169462Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b656169cb8e95ebbcbf8da3518782a3f08d0aa3e5bd9b1ce745663b2d72ca1b3","observation_id":"4f0d66af-7995-4241-a8f3-cbd11731efc1","resolution":{"observed_at":"2026-08-07T14:44:23.169462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03013","last_updated":"2022-11-06T02:59:27Z","snapshot_observed_at":"2026-07-06T14:14:54.215334Z","submitted_at":"2022-11-06T02:59:27Z","title":"Robust Lottery Tickets for Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03013","snapshot_observed_at":"2026-08-07T14:44:23.206606Z","title":"Robust Lottery Tickets for Pre-trained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.206606Z"},"links":{"cited_paper":"/paper/2211.03013","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:64e3cb9de4c4727d0d0bc943369797e5da2a2bf67e1ccd4a5d4ce33e3631a449","observation_id":"fcc68dc2-e072-4c77-b691-d4632248eb78","resolution":{"observed_at":"2026-08-07T14:44:23.206606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5555/2381019","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.239220Z","title":"Ensemble Methods: Foundations and Algorithms","venue":null,"work_id":"3994b3ab-ccea-42bb-b8f9-eff99a368a0f","year":2012},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.210297Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:10a7a4c97bdefd9363d1d66b7fa8cb4d7ec739b4862a7ad64d184876eda6c70e","observation_id":"64500586-55ab-44f4-9a0c-51c43c7515b2","resolution":{"observed_at":"2026-08-07T14:44:23.274690Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":56,"verified_exact":17,"verified_fuzzy":9},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2505.17909."}