{"as_of":"2026-08-19T00:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:959c160d6797e52b666715f4b3e432a98d0a62aa71c204ebac9de3ed1c4faa6b","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:01.600260Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12471/citation-record","integrity":"/paper/2504.12471/integrity","json":"/paper/2504.12471/citation-record.json","paper":"/paper/2504.12471"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T12:40:01.378085Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.378085Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:30e8e7b59300e5d47cfe07a88d2dfb4f3608cb1e593eaf02eb3bc1dba61dde7d","observation_id":"d5bc583a-1d18-4d07-b544-3cfbc9c63eca","resolution":{"observed_at":"2026-08-16T12:40:01.378085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-16T12:40:01.383768Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.383768Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:b8fae66d674740ac4d2c8eb6f821bcfcc22843c5c972e04bd390176487e4a89c","observation_id":"04709667-ddbf-405f-a4bd-73688a44223d","resolution":{"observed_at":"2026-08-16T12:40:01.383768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.389715Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.389715Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:a4be4ed1a0d1ee6a6601677b4b9b39600837901dc9990947aef868c2e2aab53b","observation_id":"02205f2c-1793-4a17-99bf-9f8710723541","resolution":{"observed_at":"2026-08-16T12:40:01.389715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.394718Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.394718Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:e1c76ae01ee73e390b60f4bc19b6a56075c03fc0a2e8ee3adc86783b0ea4f871","observation_id":"d6e31786-ba41-4a6b-a1f7-3ff7ca54effd","resolution":{"observed_at":"2026-08-16T12:40:01.394718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-16T12:40:01.399645Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.399645Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:d994ed405294aa68d45bada912e66624605360d6ff51290e6729cafe037ab999","observation_id":"82e43c9f-4fc6-4ad5-ae42-b7508533dd6a","resolution":{"observed_at":"2026-08-16T12:40:01.399645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-18T22:17:47.865607Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-16T12:40:01.404894Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.404894Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:146d1f325cd2db9c940365ec333ffd2818831b37baf550cf83fdb078ab3fa6f0","observation_id":"3a1ef966-eeb9-4a2e-b753-49bee8ac847e","resolution":{"observed_at":"2026-08-16T12:40:01.404894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.410614Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.410614Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:9e1ab4a501761486cc88d1c89215107740473113617bdb83c898c8d5012eeb23","observation_id":"e3d99227-abc4-49eb-a972-63038d69d19e","resolution":{"observed_at":"2026-08-16T12:40:01.410614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.267058Z","title":"Train big, then compress: Rethinking model size for efficient training and inference of transformers,","venue":null,"work_id":"2d4abf29-52e1-4fd1-a482-6d5f85208da5","year":2020},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.415236Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:678f666f49d0367e4d619d54268f787d6623746473c637aade3f0db3c7bd7fd4","observation_id":"86087a9a-baec-4b2b-a6dc-ae24c91e7838","resolution":{"observed_at":"2026-08-16T12:40:02.272089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.419869Z","title":"Decoupled greedy learning of cnns,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.419869Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:6dab460a5435a4a847d34f0280613eafa234240ae70e6badedf371a4bf607113","observation_id":"0e480de8-554a-4c8f-a501-7298829a108a","resolution":{"observed_at":"2026-08-16T12:40:01.419869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.241512Z","title":"Distributed learning of fully connected neural networks using indepen- dent subnet training,","venue":null,"work_id":"fb78d482-a7d3-4afb-b91b-3dae5dfdc62a","year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.424539Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:c72ef06059ac64468ee93fd6a39a4ca33d253a21ceea6c36c5856b053aa25132","observation_id":"4e8f5d6b-9443-41c8-bf3c-74974535856d","resolution":{"observed_at":"2026-08-16T12:40:02.246274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.224753Z","title":"Decentralized training of foundation models in heterogeneous environments,","venue":null,"work_id":"b78c8c3d-f5bd-4429-8097-47e65c0d72b4","year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.429256Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:d360e503690db8da82f038aac27b2520d6dc0495c9dec88dc4c1ab1e2e03453d","observation_id":"c023a108-ae6c-4b7d-8f26-6d9c6cc591b6","resolution":{"observed_at":"2026-08-16T12:40:02.230088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T12:40:01.434243Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.434243Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:3f06e26c5296a046141a827f094f2f2783351d663fa7669cebe8b6326eeb939a","observation_id":"f041e34f-aae2-4916-9ead-f60fc8ea61d7","resolution":{"observed_at":"2026-08-16T12:40:01.434243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-08-14T00:06:21.089704Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-16T12:40:01.439349Z","title":"Gspmd: general and scalable parallelization for ml computation graphs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.439349Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:fe75005cc4fffca855e179741d57c77b39ed7666154b80c02eaa7ad945baeb22","observation_id":"6faf335d-8fd7-4e43-96fd-e2b04e8c3269","resolution":{"observed_at":"2026-08-16T12:40:01.439349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.209800Z","title":"An efficient 2d method for training super-large deep learning models,","venue":null,"work_id":"c1acdef5-e4b1-4d3b-8489-92584ff00c48","year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.444343Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:3167cd2009c73a3b1f5411d2c1bb3a41bd6bfb7a45c9f2f11b5df71a92d295ee","observation_id":"ccaef75d-83c5-4b45-8cec-db44cf6b1fc8","resolution":{"observed_at":"2026-08-16T12:40:02.214409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14450","last_updated":"2021-05-30T07:41:08Z","snapshot_observed_at":"2026-08-16T18:21:16.383131Z","submitted_at":"2021-05-30T07:41:08Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14450","snapshot_observed_at":"2026-08-16T12:40:01.449128Z","title":"Maximizing parallelism in distributed training for huge neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.449128Z"},"links":{"cited_paper":"/paper/2105.14450","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:839e32857f69ba0d13fc10e07f5a89d040f971fbb7cde3f4f20e9d221c0fbba0","observation_id":"4320ec30-7210-40a5-a002-fee5d1716e03","resolution":{"observed_at":"2026-08-16T12:40:01.449128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.454113Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.454113Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:1d8f2c55506dd088f014051f44ff69553f4627e7690fba8ec2327f7b1bc0cd26","observation_id":"49b9a9a7-10df-4ba2-ae0c-5e966e4f8c9b","resolution":{"observed_at":"2026-08-16T12:40:01.454113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T12:40:01.458824Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.458824Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:01846911030dc22e936ae2d95f4976474d1581ce94d0a6f9629e9ffe7311f499","observation_id":"56549b7d-b47f-46af-a1bc-77c70bf23c34","resolution":{"observed_at":"2026-08-16T12:40:01.458824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T12:40:01.463962Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.463962Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:49295a656ec1881f0a0595b48e3b40d83456c379f1bcec90b94e395a1d96059a","observation_id":"eb481c18-cf18-4341-ad44-d177df2609b1","resolution":{"observed_at":"2026-08-16T12:40:01.463962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.469195Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.469195Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:979466ad90a3a2a2830821e721d4e3c0bd4127267eb8a3e24e95f88fbc42578a","observation_id":"4dc69d1d-4ee9-45f5-9ddb-999c73ec0a71","resolution":{"observed_at":"2026-08-16T12:40:01.469195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.474722Z","title":"Transformer in transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.474722Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:0578d9de4382ed9447ba8521b8f9822fc36e26f0d977d96b280992f055d48373","observation_id":"f9f12e04-89a8-4707-a8c8-a7cea08d65a3","resolution":{"observed_at":"2026-08-16T12:40:01.474722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07253","last_updated":"2020-06-12T15:07:08Z","snapshot_observed_at":"2026-08-05T10:40:41.198153Z","submitted_at":"2020-06-12T15:07:08Z","title":"Dynamic Model Pruning with Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07253","snapshot_observed_at":"2026-08-16T12:40:01.479454Z","title":"Dynamic model pruning with feedback,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.479454Z"},"links":{"cited_paper":"/paper/2006.07253","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:5851480a23c1e7791d9f6d743b4f135a22e088a13d16c041f68aeade864f8c8f","observation_id":"eeb14255-c24c-408c-8437-a2b1da53971e","resolution":{"observed_at":"2026-08-16T12:40:01.479454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.162654Z","title":"Single-shot pruning for pre-trained models: Rethinking the importance of magnitude pruning,","venue":null,"work_id":"222ecaad-c28a-4d7d-a950-18653d3ae11d","year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.484437Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:79c17cb4b22bb94be2cbb493cbfd8ae88ae56fa4dc897f5ae24147bdd5f593a0","observation_id":"1ab2105b-d984-4bf5-a5f1-82535f07fb4e","resolution":{"observed_at":"2026-08-16T12:40:02.168168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.144943Z","title":"Resource- efficient transformer pruning for finetuning of large models,","venue":null,"work_id":"d381f5cc-2ba5-4fde-8669-310d771361ff","year":2024},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.489089Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:97d1bc6262bdd4d72b549a16c654979705a3088ec975a4520b0fa29708d4c8cf","observation_id":"175af5f5-08f8-440a-92db-bd0b027f9159","resolution":{"observed_at":"2026-08-16T12:40:02.150004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.128894Z","title":"Martello and P","venue":null,"work_id":"bd2a10c4-f4ad-4883-9dd3-8c1239eac316","year":1990},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.493907Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:2423709f59b5265ad57e7678d5d7c34e37dc78531db7594aeee239dbd2a9ce31","observation_id":"a8d6db2d-79ac-45cb-ba58-e75a61e57f95","resolution":{"observed_at":"2026-08-16T12:40:02.133939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.113454Z","title":"A class of generalized greedy algorithms for the multi-knapsack problem,","venue":null,"work_id":"f9ce6d91-f324-471f-b190-dd9f64d7c3e2","year":1993},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.498626Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:ba352235408eabb6716298e90ec35db0a641ea723f0e181d4027c3a50d431bc0","observation_id":"10bfffd0-03f8-4671-b402-0ab5a23e6dd0","resolution":{"observed_at":"2026-08-16T12:40:02.118280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.097597Z","title":"Dynamic programming revisited: Improving knapsack algorithms,","venue":null,"work_id":"7ee6d4f8-ff8c-4eba-b10e-222fa779aef2","year":1999},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.503067Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:f4ea2a958ffecb41d9f94b5bf4abe9ebe605cebbeeab7d6df1b70cb54f8ade2d","observation_id":"33ba2ba8-7552-4e28-a629-1a4b909625ba","resolution":{"observed_at":"2026-08-16T12:40:02.102410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.082074Z","title":"An approximate dynamic programming ap- proach to multidimensional knapsack problems,","venue":null,"work_id":"12d7b6d7-4026-45de-9fd0-4cd6588271ca","year":2002},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.507570Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:38c66591692bf38c98be43dd3733194b6d38ee40d87bca6f65944c52d5790cc4","observation_id":"56e54159-64e2-4182-ac57-1cf760711725","resolution":{"observed_at":"2026-08-16T12:40:02.087031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.512195Z","title":"Pytorch image models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.512195Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:dc6ce7e0fa701b9945616e692ec83a68136115eff778569dd76190ad7cb277b1","observation_id":"894fd2b9-442b-47c7-a8bc-b9890dacd224","resolution":{"observed_at":"2026-08-16T12:40:01.512195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.054779Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":"a3e64d84-ca5e-4232-9439-a793a51e3f85","year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.516879Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:d40ecf96e6068db2b25f64a7cfc72a48620c6a519cf55bb828277909abc121a4","observation_id":"85a95a5f-ce58-4558-9e6a-e90d1ab14813","resolution":{"observed_at":"2026-08-16T12:40:02.060041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-16T12:40:01.521699Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.521699Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:9c6c4c74c069145a448651b3fde14037b13c06904ec72200732d5482576006a4","observation_id":"71ca0b38-9469-4d83-9c36-cc4b77b0b685","resolution":{"observed_at":"2026-08-16T12:40:01.521699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.039090Z","title":"Where to pay attention in sparse training for feature selection?","venue":null,"work_id":"53af63f2-fbec-4ab6-8a7e-b21cced39367","year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.526599Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:d6b57ced0fcb976e42b7bb3430b378b9dcb8d23949af08118e716e94d6a6c891","observation_id":"bcab0ed5-41ea-4fbb-9e57-1557970f507c","resolution":{"observed_at":"2026-08-16T12:40:02.044084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-16T12:40:01.531151Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.531151Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:591e20873d5382a7d803f79923b43867c11362ba244a4a7822bd712298b8d18d","observation_id":"5ef3de64-789e-440e-8201-99704436b26f","resolution":{"observed_at":"2026-08-16T12:40:01.531151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.536230Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.536230Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:094c08e4ac7a9688aa2feb9a9581d1f4f28be6280bc7cd47063c38aec4378779","observation_id":"bb564558-b981-491a-8465-66bf03934ff4","resolution":{"observed_at":"2026-08-16T12:40:01.536230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.540973Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.540973Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:e68b0e8111d2edcd6d5be67dc681d6f17a4de850930a0b2ac91b11736fbbf40b","observation_id":"7bc1e12c-f978-4af8-a3a0-f45e3d1e71a4","resolution":{"observed_at":"2026-08-16T12:40:01.540973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.15082","last_updated":"2021-08-09T15:33:59Z","snapshot_observed_at":"2026-08-18T09:18:34.928300Z","submitted_at":"2021-05-31T16:12:44Z","title":"M6-T: Exploring Sparse Expert Models and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.15082","snapshot_observed_at":"2026-08-16T12:40:01.546388Z","title":"M6-t: Exploring sparse expert models and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.546388Z"},"links":{"cited_paper":"/paper/2105.15082","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:f902c91d3ac05e079da4639009f380f2f65cbf5057285453e66579b60547b991","observation_id":"0c8373a6-2710-4d9c-ad0b-523a863bc711","resolution":{"observed_at":"2026-08-16T12:40:01.546388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-08-16T17:50:47.632734Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-16T12:40:01.551591Z","title":"Taming sparsely activated transformer with stochastic experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.551591Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:f94b91cb3798aae0999e2835e788cfe33bd88ea24b8be9daa2355da2db5f7074","observation_id":"aee6c30a-1aff-4e7b-9b8a-135de7eab909","resolution":{"observed_at":"2026-08-16T12:40:01.551591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.001926Z","title":"Hash layers for large sparse models,","venue":null,"work_id":"e374b2d1-c255-4765-b0da-d884e0788fa6","year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.556853Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:2a37be526b2bceb622c83ef659ff43ba1053a7a10f14403014271f0445acf6a6","observation_id":"0050a150-c160-4e2e-b3ed-daaa81272531","resolution":{"observed_at":"2026-08-16T12:40:02.006695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02340","last_updated":"2019-02-23T07:45:29Z","snapshot_observed_at":"2026-08-16T06:51:50.505762Z","submitted_at":"2018-10-04T17:39:58Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02340","snapshot_observed_at":"2026-08-16T12:40:01.561592Z","title":"Snip: Single-shot network pruning based on connection sensitivity,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.561592Z"},"links":{"cited_paper":"/paper/1810.02340","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:35567ae67047f372c0d63f2cc09250940e121cca057bca9faef7202d6e9c4748","observation_id":"2fdb58dd-8b11-4296-a9a1-d46c85de0cc2","resolution":{"observed_at":"2026-08-16T12:40:01.561592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-10T04:53:00.900945Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-16T12:40:01.566591Z","title":"Picking winning tickets before training by preserving gradient flow,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.566591Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:d092f77a8c91b85e96568d06e0af0d0298c16bd827f25c9a6ee5e1ba27cd3450","observation_id":"691ce3dc-2c8d-4d70-971d-cd7ec6a0d0c9","resolution":{"observed_at":"2026-08-16T12:40:01.566591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.571670Z","title":"Learning both weights and con- nections for efficient neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.571670Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:bb6a1ca9d57ac1a88ea0a69760f6cefd7020acbdded4126cc1c32431930744e8","observation_id":"87a996e3-6500-4902-9882-304c8bec13aa","resolution":{"observed_at":"2026-08-16T12:40:01.571670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.973423Z","title":"Dynamic network surgery for efficient dnns,","venue":null,"work_id":"dd6bcc25-7e36-435f-91ef-4dd6c57f7b63","year":2016},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.576409Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:cd03ff17cf2ee4ce76acae5288cdb9b7373173ce9b419f465af521cb96e6e1ae","observation_id":"a2f50ac5-1285-4a8d-b766-85a488798fb9","resolution":{"observed_at":"2026-08-16T12:40:01.978419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.957989Z","title":"Compression-aware training of deep networks,","venue":null,"work_id":"c0eebb80-757a-4396-8101-42a9b725ea09","year":2017},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.581071Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:cc1d189bcf0c4f93ca40cf9d82f877d64d9a6deee94a07cc3777b676ebf6ec7e","observation_id":"1d97bb73-1bef-4b96-a880-e413ea0a24fc","resolution":{"observed_at":"2026-08-16T12:40:01.962721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.942337Z","title":"“learning-compression","venue":null,"work_id":"d15af60d-dc86-4fcf-8034-668cca4647e2","year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.585807Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:9f866dc9665720e99231d78ed9882d7e2013dc24f0510ade2f5460de70e483b1","observation_id":"758b4354-cabb-4fbd-b152-cb64229f978a","resolution":{"observed_at":"2026-08-16T12:40:01.947063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-16T12:40:01.590570Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.590570Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:320645817b96fd0a907d04fa5e9a58f6092c3d62a2a6b78647dea834114c5a3f","observation_id":"49c00761-95bd-49c7-88a0-208a1f28b007","resolution":{"observed_at":"2026-08-16T12:40:01.590570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.925960Z","title":"Efficient lottery ticket finding: Less data is more,","venue":null,"work_id":"20e417e4-7c40-447c-b9ab-e98a69264f4f","year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.595807Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:39d1a7a2fae30909fe0179fe5e1f14a01efe875ab46082e3659af7e6a6c37ba1","observation_id":"02b0f596-11a5-4078-b95f-c9a752d8a809","resolution":{"observed_at":"2026-08-16T12:40:01.930852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.907525Z","title":"The lottery ticket hypothesis for object recognition,","venue":null,"work_id":"22096a31-f0c3-425d-9e83-bac217bc6529","year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.600260Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:e1c429daa47d8e1630ba51fe8347802c1817785c444cdf5f1b5caf14f1d4fce7","observation_id":"2601157b-698e-4da9-97c2-fcb0decdc4d9","resolution":{"observed_at":"2026-08-16T12:40:01.914443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T20:24:35.090578Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2504.12471."}