{"as_of":"2026-08-07T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81529bd5fd87e1acffe5001e34b52f39ecd744c5f6ab1a6f75acfd7353ae1465","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:36:04.095237Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24241/citation-record","integrity":"/paper/2505.24241/integrity","json":"/paper/2505.24241/citation-record.json","paper":"/paper/2505.24241"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:35:56.815675Z","title":"Gpt-4 technical report.ArXiv, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:56.815675Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:03a22075d44722f700b0bc64c3ff698bb93be5fc3b8b09e4fdb537a2b5453f49","observation_id":"1f61e9e3-18a0-4949-819c-8c3922f02abd","resolution":{"observed_at":"2026-08-07T12:35:56.815675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T12:35:56.859950Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:56.859950Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:1484b11b6a4ecbba0ca78aa3383f1c7a039156f1d713868b69ab18350884e6f3","observation_id":"9d46bd6f-28b3-49fd-bea7-a1c13c9f70dd","resolution":{"observed_at":"2026-08-07T12:35:56.859950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:35:56.928598Z","title":"Llama 2: Open foundation and fine-tuned chat models.CoRR, abs/2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:56.928598Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c50cef5b5ad15b85fe8796abfb89bc663981c960a0a1583cee6733deaa9c5051","observation_id":"a388e5db-f362-4c17-89a9-a1494ffec41b","resolution":{"observed_at":"2026-08-07T12:35:56.928598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:35:57.077405Z","title":"Llama: Open and efficient foundation language models.ArXiv, abs/2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.077405Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a210bb2dc3ca555058cc711747af8d764158fa802dc70f311e336720696eeccf","observation_id":"742de2b7-24dc-4ade-81d7-82cbb3fce188","resolution":{"observed_at":"2026-08-07T12:35:57.077405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.873260Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":"34bbb969-42a5-4b57-9d66-4bcdc45b553e","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.230302Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:55ac9793f709e194281ecd566e493af7df4b2cb31ab3419f52616eedfb4f63b8","observation_id":"f948af2c-4bb5-421f-9f82-4ffd50071216","resolution":{"observed_at":"2026-08-07T12:36:12.975629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:57.387978Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.387978Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:e1f52be277ab82554ba1dfcfbb68b6904d94bbb6583bcd17d422e703e93eaff6","observation_id":"cb7c4bf5-47f7-4534-a993-ac93f25e78aa","resolution":{"observed_at":"2026-08-07T12:35:57.387978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:57.526418Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.526418Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:333fcdf61d552a66e03c1113ac89523d4611df25061ac9f928d2c48152c912b5","observation_id":"ce26dad9-fd19-49e8-9d8c-6e15fde7f1a8","resolution":{"observed_at":"2026-08-07T12:35:57.526418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:57.693685Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.693685Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:b0a8f2e2185788d8c53d2e32369b4ba1bff31d97f026593b1d51c7d33fe3cbc3","observation_id":"8835867b-243b-4f17-94c3-99f3818dd42a","resolution":{"observed_at":"2026-08-07T12:35:57.693685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.585734Z","title":"PiSSA: Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":"53f83af9-cbfd-4238-becb-9cb7e26e6805","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.853270Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:7a9a7fa88ed2152ea344b7f14389de91dafab12219017d209265b854526fd772","observation_id":"c10ed9c0-f874-468a-9545-084becb81d9e","resolution":{"observed_at":"2026-08-07T12:36:12.715904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.279808Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":"fb3ac7a4-7815-41c0-b518-e34797ed44f9","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.009136Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5bad2fc693acc504744dfab2e9405cfdc0835ada722b8fe4d29ed171d7c9e9ec","observation_id":"016d757b-1a1d-4f55-a4b2-6e9a78f6e201","resolution":{"observed_at":"2026-08-07T12:36:12.393486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.012691Z","title":"A win-win deal: Towards sparse and robust pre-trained language models","venue":null,"work_id":"97247c08-8c68-4227-9e63-4cea701b94be","year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.167465Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:487ad85888aacdfabfa80044c598445e0e19b9a6b39c8797d276084749d17e74","observation_id":"5ae5f2e7-603b-43ef-871a-03993a2e9118","resolution":{"observed_at":"2026-08-07T12:36:12.124879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:11.760374Z","title":"The lottery LLM hypothesis, rethinking what abilities should LLM compression preserve? In The Fourth Blogpost Track at ICLR 2025, 2025","venue":null,"work_id":"c99cbd50-ff5c-478c-8fbd-715950bb5754","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.290700Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:3ae5f1be2cfd036e51416defaeba7a05ddebc81bb1d12f3817ef0f10738d2b34","observation_id":"e0907c83-b83c-4b63-8a8f-06d9867c76f8","resolution":{"observed_at":"2026-08-07T12:36:11.886754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:11.542843Z","title":"LLM-pruner: On the structural pruning of large language models","venue":null,"work_id":"597cb5a7-f2cf-44d7-a892-8642a6b193d2","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.477227Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:35da2e05061e4387e3225b9af059381f36cd8c36431ed47d9175f623cf85f7ee","observation_id":"f03907e4-aaae-4ae3-8829-63c601ff2a46","resolution":{"observed_at":"2026-08-07T12:36:11.635534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:11.321050Z","title":"Fluctuation-based adaptive structured pruning for large language models","venue":null,"work_id":"59ee2a3b-4640-48b0-b332-56df447b6aab","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.569539Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:7eb14b71db3e4d30414191587a26b5670185db4654e8d0fed052ccc12895d0a3","observation_id":"2d14abcc-74bd-4312-9a0b-3f033c82e42a","resolution":{"observed_at":"2026-08-07T12:36:11.447956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.992391Z","title":"Discovering sparsity allocation for layer-wise pruning of large language models","venue":null,"work_id":"b6995017-6b4f-49ee-b905-cd2c3ec1182e","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.638519Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:2f7a2a788742085c92e32c9ff77f237d4f4c02e656bdc12a32a9eac760b17894","observation_id":"10f192e8-6c95-49ec-8cba-3957c4c26e2a","resolution":{"observed_at":"2026-08-07T12:36:11.143106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.727119Z","title":"Structured optimal brain pruning for large language models","venue":null,"work_id":"81d0e706-1ae4-4a94-a9bb-bfb375c9ca84","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.709791Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:264e39e85e4d97d4ee3818531785d061ecf5bd8d6efbfe998c6f971ee916768e","observation_id":"4c484cda-1cc6-4e17-a064-9e99430fe594","resolution":{"observed_at":"2026-08-07T12:36:10.831673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:58.796366Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.796366Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:3ffe8c2f57b4f51a27cd8772537261f6d4a3f163af4b7f181abfd122c31b486a","observation_id":"2484238b-6924-481f-946c-aa49e58e034a","resolution":{"observed_at":"2026-08-07T12:35:58.796366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.413195Z","title":"Dauphin, Angela Fan, Michael Auli, and David Grangier","venue":null,"work_id":"608214d7-bad4-4a6c-a299-0a472dbe77f7","year":2017},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.876972Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:83ca02121475334f907619b23e0e12281391eeeb04dfda09c43acab94209c2b2","observation_id":"72d6fe9b-f0c2-4744-bd7f-0c1c46868ad5","resolution":{"observed_at":"2026-08-07T12:36:10.556850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:35:59.010249Z","title":"Training verifiers to solve math word problems.CoRR, abs/2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.010249Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:1887bf70858dcf85092ccc9e0d77e00f053f502e503ecc2730db6da2cb95ee65","observation_id":"4fa1618f-07bf-4229-aa90-2c63742e8592","resolution":{"observed_at":"2026-08-07T12:35:59.010249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.107677Z","title":"Sheared LLaMA: Accelerating language model pre-training via structured pruning","venue":null,"work_id":"93921562-a5c7-4d1c-9c59-e0a4a0e31bbc","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.119774Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c1f7da5f9461cd4e521165955c6516d7f205fd0b5a5785378e8096493f5cd541","observation_id":"650123d3-1d61-4ca3-a9d6-edcae2f4688f","resolution":{"observed_at":"2026-08-07T12:36:10.248620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.819773Z","title":null,"venue":null,"work_id":"352e40a5-ce59-420a-8e3b-8aef0f4d5179","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.228309Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:54e17833c49c49d4f45c4a746fa37b81f59710f56d09437df7c98f0b4f9730b6","observation_id":"5ec6d921-84ec-4169-b42d-ea7196ee9be6","resolution":{"observed_at":"2026-08-07T12:36:09.978283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:59.337320Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.337320Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:e657be60398703255a393a3ee1cb81736e2ee1ffc6e0929d631a6ba41ba1e44d","observation_id":"e63e96c0-a028-4d23-9465-f47306c1e1c5","resolution":{"observed_at":"2026-08-07T12:35:59.337320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:59.443637Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.443637Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:ade7c48ad54465923ae90bd824061b244ac45cb7db90194cad7f15bc314b0f57","observation_id":"eacbb448-9f19-4ecc-a9de-f2cf79ddf2cb","resolution":{"observed_at":"2026-08-07T12:35:59.443637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.528141Z","title":"Learning to grow pretrained models for efficient transformer training","venue":null,"work_id":"bd9c328e-d89c-4b7b-844b-e71e5e213a57","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.526167Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:35b829ea77d9bdb92e7a3b5d30d28d9019799955bedf29f619982a3217c4843a","observation_id":"63bf374b-0387-4f0d-be25-b6930384cae1","resolution":{"observed_at":"2026-08-07T12:36:09.691397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.287020Z","title":"LEMON: Lossless model expansion","venue":null,"work_id":"ad159003-7cd3-4943-9cab-582a4f5f8091","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.606704Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:b4c175e03c79db566497eeff0b550925a9887f59c92b6287cbdfabd297e780c0","observation_id":"b1e2a199-25e4-4da0-955c-8541b01e3a29","resolution":{"observed_at":"2026-08-07T12:36:09.380874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.058750Z","title":"Compute better spent: Replacing dense layers with structured matrices","venue":null,"work_id":"bad5bf00-e13c-42ac-b1c2-412d16d59819","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.683091Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6030c82f005e5807c6b4ea42fbb3910c025109a06d4e65b0bfc02fea4cd74134","observation_id":"6061590e-d9fd-4eec-94bb-22b8f3a80fdc","resolution":{"observed_at":"2026-08-07T12:36:09.138413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:08.837256Z","title":"LEMON: Reviving stronger and smaller LMs from larger LMs with linear parameter fusion","venue":null,"work_id":"67e17ca7-57a3-492a-b4d0-97d6fb9eea73","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.760216Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:b4790123c47f5feb3152897abfb648603ee097eb9e304153997d596af2c23298","observation_id":"bceaa59f-f172-424d-b3d3-1d9f58602c0b","resolution":{"observed_at":"2026-08-07T12:36:08.960278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:08.489281Z","title":"Effective rank and the staircase phenomenon: New insights into neural network training dynamics, 2025","venue":null,"work_id":"6f69d782-b0ea-4794-9ade-90221e17c3e7","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.864612Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:853daef08e45e70273f5b3bd5a735bb3b62ebf862c5caa9a998141bb47c204ad","observation_id":"fac36b7d-b935-403a-bbf7-36c4f179ea39","resolution":{"observed_at":"2026-08-07T12:36:08.638877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:08.244960Z","title":"Goodfellow, and Jonathon Shlens","venue":null,"work_id":"bea952e3-f6f1-4848-a686-989c3fd0875a","year":2016},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.938767Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:952902b28e49005200922ead89e2bc05c142ceffdc52b0d4952804ce4f6c6147","observation_id":"8db2113f-0267-4848-a5d8-31ecd36094ba","resolution":{"observed_at":"2026-08-07T12:36:08.359927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.956413Z","title":"bert2BERT: Towards reusable pretrained language models","venue":null,"work_id":"85f4b416-88d1-442d-90e5-760efa5ae77d","year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.037893Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:77478e3502f2543b38ee023eb1695d8e2dfe92ec71122856ab857f947884274b","observation_id":"0ffc6760-6e03-4267-8169-e38e41917817","resolution":{"observed_at":"2026-08-07T12:36:08.113687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.614659Z","title":"Peters, and Iz Beltagy","venue":null,"work_id":"02199e65-cedd-4b38-85b8-cf9a27fcf472","year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.144762Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:0990360addd09088e1435f7edd44270f8881cbfa440d13df1303cba25ebe6c55","observation_id":"dd426ef2-0e13-4661-93d2-4ad122fb230f","resolution":{"observed_at":"2026-08-07T12:36:07.770154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.323380Z","title":"Hft: Half fine-tuning for large language models, 2024","venue":null,"work_id":"2cf03e62-458c-4a51-9b5e-b93f7136d6ef","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.223463Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6aa087d513a344118404615bd57de0783f8ade2972d1bb73b877194b2ec01ccf","observation_id":"dbb7f8e8-d78c-47d3-bc55-4a20ab76b68d","resolution":{"observed_at":"2026-08-07T12:36:07.462526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.046575Z","title":"Enhancing large language model performance with gradient-based parameter selection","venue":null,"work_id":"10f5d549-bf1e-49c8-b6aa-3d333e649631","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.328789Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a5eafacab81bd44eca45455faf947f6da37eaa416b6762c21091227f9e6b6b53","observation_id":"2ba83c9b-f77e-499c-b9dd-ba4591d5aa50","resolution":{"observed_at":"2026-08-07T12:36:07.170080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.427766Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.427766Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:88a0aaa03531db78c6c07d445d1337f6b8ae23438421f959d3445c99aa702226","observation_id":"c3a61b63-516d-40cf-8a68-1c758f9fd636","resolution":{"observed_at":"2026-08-07T12:36:00.427766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.506110Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.506110Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:052b69df8a8727c92a7ee0f125e4ddcb15e5610fa9e5ec49e39af61858ea22e2","observation_id":"13151836-33de-4cdd-9b42-a2291e2bc32a","resolution":{"observed_at":"2026-08-07T12:36:00.506110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.650525Z","title":"Challenging BIG-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.650525Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a6daf57d62b466cc8456eb6d8aa7fdabf886cf4206badd0557e5898ca9bd06c8","observation_id":"fd6d97c8-fd4c-44af-b3a6-9f963ccc9af6","resolution":{"observed_at":"2026-08-07T12:36:00.650525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.725896Z","title":"Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.725896Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:864df9d9f662275b712b5e3d3810159f69f9a1213b137eea3d7fd9289744ad3e","observation_id":"87e53b83-0471-473b-a5ea-6c1c56dac2d5","resolution":{"observed_at":"2026-08-07T12:36:00.725896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.831653Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.831653Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:0c6d45b272698879ebc014ef190f74eab5ddc41ca1e6f3b7ce62b1bc1283297c","observation_id":"47aadd0f-700b-4537-bc65-3938183992d6","resolution":{"observed_at":"2026-08-07T12:36:00.831653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:36:00.938599Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.938599Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:dd26aee0d6493627666be186cf43a75eeca1d91153a24f69909ff5f8b99bf7d6","observation_id":"45a41d81-7f4d-4fcc-926b-2df1041e9610","resolution":{"observed_at":"2026-08-07T12:36:00.938599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.779209Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"b8ec6fdf-f52a-4669-bdd7-56bc587a6928","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.021295Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:dc809a367f6836d2279171e1c6fc1135e936655a16366485f77d2be7136feefa","observation_id":"19f4c7f3-ae2d-4fc8-bc2d-3d1f8bd3fe84","resolution":{"observed_at":"2026-08-07T12:36:06.907705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.487393Z","title":"DoRA: Weight-decomposed low-rank adaptation","venue":null,"work_id":"a7833933-c3ab-46d0-9062-b0bc0e6e8335","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.122294Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5ec41a70e1d396dc8b73789b1e8d7afb8ddf489164745e94abb554ed60d95e52","observation_id":"a1b38288-16e9-4da4-a615-a83fb2334782","resolution":{"observed_at":"2026-08-07T12:36:06.644737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.236896Z","title":"ReloRA: High-rank training through low-rank updates","venue":null,"work_id":"28973135-013b-4660-b600-2f7019be9bb8","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.235887Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a81e2a969c1672c0be9126f18ec3f439dd3e58875023e733e5f2ae7c5cb839d9","observation_id":"f889c35a-adb1-4327-aaff-d279e74be74e","resolution":{"observed_at":"2026-08-07T12:36:06.344360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.209802Z","title":"S2ft: Efficient, scalable and generalizable llm fine-tuning by structured sparsity","venue":null,"work_id":"94c3ed74-d339-4331-a49c-1d477025bd90","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.342708Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:bab8513c506f83178300273d9a9ae64b6d1aa6cc02365839e0d5a35f8ed512e7","observation_id":"c4a3b13a-206f-4367-8b78-c5c51632f429","resolution":{"observed_at":"2026-08-07T12:36:06.222422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:01.460218Z","title":"Tinyllama: An open-source small language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.460218Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a238d9783318b92367e5dc979e86c95373238a10a9fb776a80852d38085010c5","observation_id":"16cc2191-c65c-4366-ba84-f2f699844d43","resolution":{"observed_at":"2026-08-07T12:36:01.460218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.104127Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":"9d4d1a47-7acd-4843-ab51-6315f7819799","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.569207Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:81391eb2da6738703563a838368173533f421954b08dff54a03108ff7cc94457","observation_id":"f4fed23d-1319-4957-b585-2b5006bb67d3","resolution":{"observed_at":"2026-08-07T12:36:06.149961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:36:01.681225Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.681225Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:2d1f40bde470fef3a46045a8f93b0e259fd64cd998800582c4209c219d5a6366","observation_id":"0847a323-50ac-4a9d-937e-84d0acea18d9","resolution":{"observed_at":"2026-08-07T12:36:01.681225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-07T12:36:01.791886Z","title":"The lambada dataset: Word prediction requiring a broad discourse context.arXiv preprint arXiv:1606.06031, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.791886Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:254a056bbf636e89c7ee85f4427d4eeea62a4b537679ab1a037fb4f4242e9ca7","observation_id":"eb685274-3caf-4b20-9d74-0e8c70897eda","resolution":{"observed_at":"2026-08-07T12:36:01.791886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T12:36:01.860011Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning.arXiv preprint arXiv:2007.08124, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.860011Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:2952211264158277c2be8ca9d5b867597cf8cd5a7090bc389e04430435986bc1","observation_id":"fd506fb8-9f57-4aa0-a05e-d85de6cee7d4","resolution":{"observed_at":"2026-08-07T12:36:01.860011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.003591Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":"f245b5cf-e00b-4114-bb7e-c3842862e766","year":2020},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.968858Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:face2fcaa66f68329238be626926ee9e0ac014aa93a4d33f3adea370d010d98f","observation_id":"d9d8875b-f698-4f93-90b4-436eee36fbe0","resolution":{"observed_at":"2026-08-07T12:36:06.045296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:02.070662Z","title":"Liu, and Matt Gardner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.070662Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:02af2a7c4dec660478b4051497f66ff75ec27737931274e156b18f3922c43a24","observation_id":"b084aeb5-8f4f-46e9-ba5d-ba4a173d4eea","resolution":{"observed_at":"2026-08-07T12:36:02.070662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:02.148445Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.148445Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:62f0f0f69f506f7544f2bc12a156dc4cac9da5f549993c145ecc9b5c143c311b","observation_id":"e6d28d96-1c89-4f0f-a250-ae643ed8d2fc","resolution":{"observed_at":"2026-08-07T12:36:02.148445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.888266Z","title":"Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":"d64583de-5aac-4394-9dc6-0f823c7d081d","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.254474Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:35ffcf9be3900c349d26e090279bd6607d4437a08f76eb9e98ddc5d8552b5813","observation_id":"88d4196c-f627-4690-955e-02b5f362d57b","resolution":{"observed_at":"2026-08-07T12:36:05.937552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.780150Z","title":"Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming-Wei Chang, Andrew M","venue":null,"work_id":"fce26815-7f3b-41ab-a797-54ffdbf83a15","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.366029Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:72a8c2acf4ae2f2d3ba9c45b15833671bee15793e4bacd76e9e2950615d5fce1","observation_id":"cb37b043-42b9-40fc-b629-463701300ea5","resolution":{"observed_at":"2026-08-07T12:36:05.828632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.651497Z","title":"Learning to grow pretrained models for efficient transformer training","venue":null,"work_id":"1158b78d-421a-41d5-bb13-c27958949faa","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.464462Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:181b669a50490694edde8bffe5f7274a63fcb53302553c6c550847d716ebc1f8","observation_id":"f5c64eae-1e07-464e-bb4f-a00198043064","resolution":{"observed_at":"2026-08-07T12:36:05.725310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.499104Z","title":"Scaling smart: Accelerating large language model pre-training with small model initialization, 2024","venue":null,"work_id":"d7738f52-10c2-40cf-b83a-77d6ec1eae5f","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.551364Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5ca93474338d726975ba70a473c89bb4c62924071c83d777d3f01f03761f003e","observation_id":"edaeab5a-93e2-42ac-9b31-451cc37f11f8","resolution":{"observed_at":"2026-08-07T12:36:05.585053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:02.641265Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.641265Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:445eef553cb10b6d0f00115b26d1324b1aa2c2af89f304c612fbd3f72812d541","observation_id":"598d78ce-bc8f-4b66-815c-ed79b1be4e7a","resolution":{"observed_at":"2026-08-07T12:36:02.641265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.381029Z","title":"Parameter-efficient transfer learning with diff pruning","venue":null,"work_id":"9e254723-b643-4def-a1ad-a70b07130e49","year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.733634Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:aa4d874f808731f62ab9d681c082604d152014accb8af0a530fe1f7229670dc8","observation_id":"0ea1ddef-4d6d-4ab5-b4cf-47c4f6b43f7b","resolution":{"observed_at":"2026-08-07T12:36:05.442392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.231650Z","title":"Training neural networks with fixed sparse masks","venue":null,"work_id":"d40679dd-967c-4612-87aa-272c08a0a024","year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.819550Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:882de5f588c85abb351c12b8f6fb5fd783d305719461313a587838ecc290a264","observation_id":"75f589f9-b90d-4873-a779-047b624455da","resolution":{"observed_at":"2026-08-07T12:36:05.310344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.122627Z","title":"LoRAMoE: Alleviating world knowledge forgetting in large language models via MoE-style plugin","venue":null,"work_id":"31e3a8b4-c96d-4268-9a3e-6eec01dd0151","year":1932},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.916562Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:1edc95d2af2f0250572dd4d6c1b1b0a9801321e1c7452ae38d0ffe0090bd653e","observation_id":"093b258c-5123-43bb-9923-a5fa2272b0d5","resolution":{"observed_at":"2026-08-07T12:36:05.178736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.008625Z","title":"Open llm leaderboard v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.008625Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5bb5ff9767e5eaf54d89fa75db2b070db11ed8ab4bc3ffb6a7ab27753e786497","observation_id":"1e9fb02a-8604-4f43-96d7-2373da49bb66","resolution":{"observed_at":"2026-08-07T12:36:03.008625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.074193Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.074193Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:7fb93789193de3a4ed020abea71076eb397722af0dbec54117fb48ddd779a0b7","observation_id":"60bab649-cf82-4e8e-b539-38e4d438d58f","resolution":{"observed_at":"2026-08-07T12:36:03.074193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.145796Z","title":"Openassistant conversations – democratizing large language model alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.145796Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c76f417e30930cbe10cb884ad7086033219f45c56167c201d02db590aaeb9f5e","observation_id":"b744294a-9da6-412b-82d9-a1c3ef8ee8b8","resolution":{"observed_at":"2026-08-07T12:36:03.145796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.223776Z","title":"Instruction tuning with gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.223776Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:ecfbac767411b2f20c4fbb3d5e88c80c103d7c7d84e3449cfd187f60a1a49c40","observation_id":"d59716fd-d1ed-4e31-bf53-d803417fc55e","resolution":{"observed_at":"2026-08-07T12:36:03.223776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.322828Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.322828Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5b9c1562444be4292e80b829d6762b456b353ae725929919bdda4aa9228e3c4e","observation_id":"24e2876f-de3c-43f0-9dae-195d802dab98","resolution":{"observed_at":"2026-08-07T12:36:03.322828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.414462Z","title":"Lima: Less is more for alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.414462Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:534533a9528d48eb4284bdf4fcd898714326521f9b0f2b098876c5a326a46a45","observation_id":"01fe5386-62ca-40ef-82a2-07f015d92e28","resolution":{"observed_at":"2026-08-07T12:36:03.414462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.957085Z","title":"Wizardlm: Empowering large language models to follow complex instructions, 2023","venue":null,"work_id":"c59ecef3-f96d-4159-b1ca-e5c104266a21","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.506893Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:bdd9c088d5ce9b8657a7c3e14d76cfb06be80c977ea0f5575ced5f7ef4b36931","observation_id":"b11bd313-5788-401a-9f0f-e01ad6493522","resolution":{"observed_at":"2026-08-07T12:36:05.021454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.573739Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.573739Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:46e58c242678a1ed1dce9afe4c6288320ffd214847e4df4ebdeacfe3d9449a6f","observation_id":"606314cf-158d-4628-8818-55b540c64291","resolution":{"observed_at":"2026-08-07T12:36:03.573739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-07-06T15:12:11.121128Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-08-07T12:36:03.689722Z","title":"Llm-adapters: An adapter family for parameter-efficient fine-tuning of large language models.arXiv preprint arXiv:2304.01933, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.689722Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6a9e8999cc5a48872412164d674b4d1a38bd8746ededb83f76c45d4fd29daced","observation_id":"d5b397c3-3d60-4168-8ae1-d4814a079de6","resolution":{"observed_at":"2026-08-07T12:36:03.689722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.779296Z","title":"composer.https://github.com/mosaicml/composer/, 2021","venue":null,"work_id":"df8b6663-e9b3-453d-9aa8-0d16ca72865f","year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.756912Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:f7c8fc8e63324f6741ca360f5af1a2d522033a67307f406f4447ccf9187d401a","observation_id":"7eeb2cf9-8b95-4754-a4be-b9ba879c25bd","resolution":{"observed_at":"2026-08-07T12:36:04.853208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.616463Z","title":"Pythia: A suite for analyzing large language models across training and scaling, 2023","venue":null,"work_id":"da074958-d9a4-4ecd-bfd7-ea3f208a9d58","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.873182Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c05543df4e268f26ee2df60c40c28a733f700b48eea4be6f6663c6acf79045bb","observation_id":"68637e74-e185-4a2e-befc-228cd5ccc64e","resolution":{"observed_at":"2026-08-07T12:36:04.711088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.439304Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":"9efa8296-f8a1-4b60-aeb2-e3f634edfe3d","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:04.002718Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:e518981394361972a3c1e62ef64ebb7447f25dde1c4e3ade46995a1222dba59b","observation_id":"474f2d64-e64a-4264-9ded-cb63ac899a0a","resolution":{"observed_at":"2026-08-07T12:36:04.518059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.289986Z","title":"[68], we fine-tune them for 3 epochs","venue":null,"work_id":"b486b3d0-0c3a-4f24-a0fa-fb0972295fc0","year":null},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":8192,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:04.095237Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:daac9b83141a3c7ab81777ee98d48432d10eaeef36eb8ccfbbfdcfe9c9ebb540","observation_id":"e1820a5a-e5ab-4162-81b9-bf11f68c613d","resolution":{"observed_at":"2026-08-07T12:36:04.368810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:25:46.128565Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2505.24241."}