Pith. sign in

Paper Citation Record · LEDGER

Advantageous Parameter Expansion Training Makes Better Large Language Models

As of 7 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2505.24241.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.24241 v1

Coverage vector

measured 72 of 72 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:36:04.095237Z

measured 72 of 72 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

72 of 72 outbound references displayed

  • verified exact0
  • verified fuzzy39
  • unresolved33
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1f61e9e3-18a0-4949-819c-8c3922f02abd · outbound

This paper cites GPT-4 Technical Report.

Advantageous Parameter Expansion Training Makes Better Large Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:56.815675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:56.815675Z digest=sha256:03a22075d44722f700b0bc64c3ff698bb93be5fc3b8b09e4fdb537a2b5453f49

Observation 9d46bd6f-28b3-49fd-bea7-a1c13c9f70dd · outbound

This paper cites Mistral 7B.

Advantageous Parameter Expansion Training Makes Better Large Language Models Mistral 7B

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:56.859950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:56.859950Z digest=sha256:1484b11b6a4ecbba0ca78aa3383f1c7a039156f1d713868b69ab18350884e6f3

Observation a388e5db-f362-4c17-89a9-a1494ffec41b · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Advantageous Parameter Expansion Training Makes Better Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:56.928598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:56.928598Z digest=sha256:c50cef5b5ad15b85fe8796abfb89bc663981c960a0a1583cee6733deaa9c5051

Observation 742de2b7-24dc-4ade-81d7-82cbb3fce188 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Advantageous Parameter Expansion Training Makes Better Large Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:57.077405Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:57.077405Z digest=sha256:a210bb2dc3ca555058cc711747af8d764158fa802dc70f311e336720696eeccf

Observation f948af2c-4bb5-421f-9f82-4ffd50071216 · outbound

This paper cites Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J.

Advantageous Parameter Expansion Training Makes Better Large Language Models Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:12.975629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:57.230302Z digest=sha256:55ac9793f709e194281ecd566e493af7df4b2cb31ab3419f52616eedfb4f63b8

Observation cb7c4bf5-47f7-4534-a993-ac93f25e78aa · outbound

This paper cites Internlm2 technical report, 2024.

Advantageous Parameter Expansion Training Makes Better Large Language Models Internlm2 technical report, 2024

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:57.387978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:57.387978Z digest=sha256:e1f52be277ab82554ba1dfcfbb68b6904d94bbb6583bcd17d422e703e93eaff6

Observation ce26dad9-fd19-49e8-9d8c-6e15fde7f1a8 · outbound

This paper cites Qwen2 technical report, 2024.

Advantageous Parameter Expansion Training Makes Better Large Language Models Qwen2 technical report, 2024

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:57.526418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:57.526418Z digest=sha256:333fcdf61d552a66e03c1113ac89523d4611df25061ac9f928d2c48152c912b5

Observation 8835867b-243b-4f17-94c3-99f3818dd42a · outbound

This paper cites Smith, Iz Beltagy, and Hannaneh Hajishirzi.

Advantageous Parameter Expansion Training Makes Better Large Language Models Smith, Iz Beltagy, and Hannaneh Hajishirzi

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:57.693685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:57.693685Z digest=sha256:b0a8f2e2185788d8c53d2e32369b4ba1bff31d97f026593b1d51c7d33fe3cbc3

Observation c10ed9c0-f874-468a-9545-084becb81d9e · outbound

This paper cites PiSSA: Principal singular values and singular vectors adaptation of large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models PiSSA: Principal singular values and singular vectors adaptation of large language models

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:12.715904Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:57.853270Z digest=sha256:7a9a7fa88ed2152ea344b7f14389de91dafab12219017d209265b854526fd772

Observation 016d757b-1a1d-4f55-a4b2-6e9a78f6e201 · outbound

This paper cites The lottery ticket hypothesis: Finding sparse, trainable neural networks.

Advantageous Parameter Expansion Training Makes Better Large Language Models The lottery ticket hypothesis: Finding sparse, trainable neural networks

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:12.393486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.009136Z digest=sha256:5bad2fc693acc504744dfab2e9405cfdc0835ada722b8fe4d29ed171d7c9e9ec

Observation 5ae5f2e7-603b-43ef-871a-03993a2e9118 · outbound

This paper cites A win-win deal: Towards sparse and robust pre-trained language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models A win-win deal: Towards sparse and robust pre-trained language models

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:12.124879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.167465Z digest=sha256:487ad85888aacdfabfa80044c598445e0e19b9a6b39c8797d276084749d17e74

Observation e0907c83-b83c-4b63-8a8f-06d9867c76f8 · outbound

This paper cites The lottery LLM hypothesis, rethinking what abilities should LLM compression preserve? In The Fourth Blogpost Track at ICLR 2025, 2025.

Advantageous Parameter Expansion Training Makes Better Large Language Models The lottery LLM hypothesis, rethinking what abilities should LLM compression preserve? In The Fourth Blogpost Track at ICLR 2025, 2025

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:11.886754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.290700Z digest=sha256:3ae5f1be2cfd036e51416defaeba7a05ddebc81bb1d12f3817ef0f10738d2b34

Observation f03907e4-aaae-4ae3-8829-63c601ff2a46 · outbound

This paper cites LLM-pruner: On the structural pruning of large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models LLM-pruner: On the structural pruning of large language models

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:11.635534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.477227Z digest=sha256:35da2e05061e4387e3225b9af059381f36cd8c36431ed47d9175f623cf85f7ee

Observation 2d14abcc-74bd-4312-9a0b-3f033c82e42a · outbound

This paper cites Fluctuation-based adaptive structured pruning for large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models Fluctuation-based adaptive structured pruning for large language models

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:11.447956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.569539Z digest=sha256:7eb14b71db3e4d30414191587a26b5670185db4654e8d0fed052ccc12895d0a3

Observation 10f192e8-6c95-49ec-8cba-3957c4c26e2a · outbound

This paper cites Discovering sparsity allocation for layer-wise pruning of large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models Discovering sparsity allocation for layer-wise pruning of large language models

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:11.143106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.638519Z digest=sha256:2f7a2a788742085c92e32c9ff77f237d4f4c02e656bdc12a32a9eac760b17894

Observation 4c484cda-1cc6-4e17-a064-9e99430fe594 · outbound

This paper cites Structured optimal brain pruning for large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models Structured optimal brain pruning for large language models

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:10.831673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.709791Z digest=sha256:264e39e85e4d97d4ee3818531785d061ecf5bd8d6efbfe998c6f971ee916768e

Observation 2484238b-6924-481f-946c-aa49e58e034a · outbound

This paper cites A simple and effective pruning approach for large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models A simple and effective pruning approach for large language models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:58.796366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:58.796366Z digest=sha256:3ffe8c2f57b4f51a27cd8772537261f6d4a3f163af4b7f181abfd122c31b486a

Observation 72d6fe9b-f0c2-4744-bd7f-0c1c46868ad5 · outbound

This paper cites Dauphin, Angela Fan, Michael Auli, and David Grangier.

Advantageous Parameter Expansion Training Makes Better Large Language Models Dauphin, Angela Fan, Michael Auli, and David Grangier

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:10.556850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:58.876972Z digest=sha256:83ca02121475334f907619b23e0e12281391eeeb04dfda09c43acab94209c2b2

Observation 4fa1618f-07bf-4229-aa90-2c63742e8592 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Advantageous Parameter Expansion Training Makes Better Large Language Models Training Verifiers to Solve Math Word Problems

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:59.010249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:59.010249Z digest=sha256:1887bf70858dcf85092ccc9e0d77e00f053f502e503ecc2730db6da2cb95ee65

Observation 650123d3-1d61-4ca3-a9d6-edcae2f4688f · outbound

This paper cites Sheared LLaMA: Accelerating language model pre-training via structured pruning.

Advantageous Parameter Expansion Training Makes Better Large Language Models Sheared LLaMA: Accelerating language model pre-training via structured pruning

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:10.248620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.119774Z digest=sha256:c1f7da5f9461cd4e521165955c6516d7f205fd0b5a5785378e8096493f5cd541

Observation 5ec6d921-84ec-4169-b42d-ea7196ee9be6 · outbound

This paper cites an unresolved cited work.

Advantageous Parameter Expansion Training Makes Better Large Language Models Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:36:09.978283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.228309Z digest=sha256:54e17833c49c49d4f45c4a746fa37b81f59710f56d09437df7c98f0b4f9730b6

Observation e63e96c0-a028-4d23-9465-f47306c1e1c5 · outbound

This paper cites an unresolved cited work.

Advantageous Parameter Expansion Training Makes Better Large Language Models Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:59.337320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:59.337320Z digest=sha256:e657be60398703255a393a3ee1cb81736e2ee1ffc6e0929d631a6ba41ba1e44d

Observation eacbb448-9f19-4ecc-a9de-f2cf79ddf2cb · outbound

This paper cites Massive activations in large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models Massive activations in large language models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:59.443637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:59.443637Z digest=sha256:ade7c48ad54465923ae90bd824061b244ac45cb7db90194cad7f15bc314b0f57

Observation 63bf374b-0387-4f0d-be25-b6930384cae1 · outbound

This paper cites Learning to grow pretrained models for efficient transformer training.

Advantageous Parameter Expansion Training Makes Better Large Language Models Learning to grow pretrained models for efficient transformer training

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:09.691397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.526167Z digest=sha256:35b829ea77d9bdb92e7a3b5d30d28d9019799955bedf29f619982a3217c4843a

Observation b1e2a199-25e4-4da0-955c-8541b01e3a29 · outbound

This paper cites LEMON: Lossless model expansion.

Advantageous Parameter Expansion Training Makes Better Large Language Models LEMON: Lossless model expansion

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:09.380874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.606704Z digest=sha256:b4c175e03c79db566497eeff0b550925a9887f59c92b6287cbdfabd297e780c0

Observation 6061590e-d9fd-4eec-94bb-22b8f3a80fdc · outbound

This paper cites Compute better spent: Replacing dense layers with structured matrices.

Advantageous Parameter Expansion Training Makes Better Large Language Models Compute better spent: Replacing dense layers with structured matrices

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:09.138413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.683091Z digest=sha256:6030c82f005e5807c6b4ea42fbb3910c025109a06d4e65b0bfc02fea4cd74134

Observation bceaa59f-f172-424d-b3d3-1d9f58602c0b · outbound

This paper cites LEMON: Reviving stronger and smaller LMs from larger LMs with linear parameter fusion.

Advantageous Parameter Expansion Training Makes Better Large Language Models LEMON: Reviving stronger and smaller LMs from larger LMs with linear parameter fusion

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:08.960278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.760216Z digest=sha256:b4790123c47f5feb3152897abfb648603ee097eb9e304153997d596af2c23298

Observation fac36b7d-b935-403a-bbf7-36c4f179ea39 · outbound

This paper cites Effective rank and the staircase phenomenon: New insights into neural network training dynamics, 2025.

Advantageous Parameter Expansion Training Makes Better Large Language Models Effective rank and the staircase phenomenon: New insights into neural network training dynamics, 2025

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:08.638877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.864612Z digest=sha256:853daef08e45e70273f5b3bd5a735bb3b62ebf862c5caa9a998141bb47c204ad

Observation 8db2113f-0267-4848-a5d8-31ecd36094ba · outbound

This paper cites Goodfellow, and Jonathon Shlens.

Advantageous Parameter Expansion Training Makes Better Large Language Models Goodfellow, and Jonathon Shlens

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:08.359927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:35:59.938767Z digest=sha256:952902b28e49005200922ead89e2bc05c142ceffdc52b0d4952804ce4f6c6147

Observation 0ffc6760-6e03-4267-8169-e38e41917817 · outbound

This paper cites bert2BERT: Towards reusable pretrained language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models bert2BERT: Towards reusable pretrained language models

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:08.113687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:00.037893Z digest=sha256:77478e3502f2543b38ee023eb1695d8e2dfe92ec71122856ab857f947884274b

Observation dd426ef2-0e13-4661-93d2-4ad122fb230f · outbound

This paper cites Peters, and Iz Beltagy.

Advantageous Parameter Expansion Training Makes Better Large Language Models Peters, and Iz Beltagy

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:07.770154Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:00.144762Z digest=sha256:0990360addd09088e1435f7edd44270f8881cbfa440d13df1303cba25ebe6c55

Observation dbb7f8e8-d78c-47d3-bc55-4a20ab76b68d · outbound

This paper cites Hft: Half fine-tuning for large language models, 2024.

Advantageous Parameter Expansion Training Makes Better Large Language Models Hft: Half fine-tuning for large language models, 2024

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:07.462526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:00.223463Z digest=sha256:6aa087d513a344118404615bd57de0783f8ade2972d1bb73b877194b2ec01ccf

Observation 2ba83c9b-f77e-499c-b9dd-ba4591d5aa50 · outbound

This paper cites Enhancing large language model performance with gradient-based parameter selection.

Advantageous Parameter Expansion Training Makes Better Large Language Models Enhancing large language model performance with gradient-based parameter selection

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:07.170080Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:00.328789Z digest=sha256:a5eafacab81bd44eca45455faf947f6da37eaa416b6762c21091227f9e6b6b53

Observation c3a61b63-516d-40cf-8a68-1c758f9fd636 · outbound

This paper cites Llama 2: Open foundation and fine-tuned chat models, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Llama 2: Open foundation and fine-tuned chat models, 2023

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:00.427766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:00.427766Z digest=sha256:88a0aaa03531db78c6c07d445d1337f6b8ae23438421f959d3445c99aa702226

Observation 13151836-33de-4cdd-9b42-a2291e2bc32a · outbound

This paper cites Measuring massive multitask language understanding.

Advantageous Parameter Expansion Training Makes Better Large Language Models Measuring massive multitask language understanding

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:00.506110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:00.506110Z digest=sha256:052b69df8a8727c92a7ee0f125e4ddcb15e5610fa9e5ec49e39af61858ea22e2

Observation fd6d97c8-fd4c-44af-b3a6-9f963ccc9af6 · outbound

This paper cites Challenging BIG-bench tasks and whether chain-of-thought can solve them.

Advantageous Parameter Expansion Training Makes Better Large Language Models Challenging BIG-bench tasks and whether chain-of-thought can solve them

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:00.650525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:00.650525Z digest=sha256:a6daf57d62b466cc8456eb6d8aa7fdabf886cf4206badd0557e5898ca9bd06c8

Observation 87e53b83-0471-473b-a5ea-6c1c56dac2d5 · outbound

This paper cites Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki.

Advantageous Parameter Expansion Training Makes Better Large Language Models Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:00.725896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:00.725896Z digest=sha256:864df9d9f662275b712b5e3d3810159f69f9a1213b137eea3d7fd9289744ad3e

Observation 47aadd0f-700b-4537-bc65-3938183992d6 · outbound

This paper cites TruthfulQA: Measuring how models mimic human falsehoods.

Advantageous Parameter Expansion Training Makes Better Large Language Models TruthfulQA: Measuring how models mimic human falsehoods

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:00.831653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:00.831653Z digest=sha256:0c6d45b272698879ebc014ef190f74eab5ddc41ca1e6f3b7ce62b1bc1283297c

Observation 45a41d81-7f4d-4fcc-926b-2df1041e9610 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Advantageous Parameter Expansion Training Makes Better Large Language Models Evaluating Large Language Models Trained on Code

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:00.938599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:00.938599Z digest=sha256:dd26aee0d6493627666be186cf43a75eeca1d91153a24f69909ff5f8b99bf7d6

Observation 19f4c7f3-ae2d-4fc8-bc2d-3d1f8bd3fe84 · outbound

This paper cites Parameter-efficient transfer learning for NLP.

Advantageous Parameter Expansion Training Makes Better Large Language Models Parameter-efficient transfer learning for NLP

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:06.907705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:01.021295Z digest=sha256:dc809a367f6836d2279171e1c6fc1135e936655a16366485f77d2be7136feefa

Observation a1b38288-16e9-4da4-a615-a83fb2334782 · outbound

This paper cites DoRA: Weight-decomposed low-rank adaptation.

Advantageous Parameter Expansion Training Makes Better Large Language Models DoRA: Weight-decomposed low-rank adaptation

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:06.644737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:01.122294Z digest=sha256:5ec41a70e1d396dc8b73789b1e8d7afb8ddf489164745e94abb554ed60d95e52

Observation f889c35a-adb1-4327-aaff-d279e74be74e · outbound

This paper cites ReloRA: High-rank training through low-rank updates.

Advantageous Parameter Expansion Training Makes Better Large Language Models ReloRA: High-rank training through low-rank updates

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:06.344360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:01.235887Z digest=sha256:a81e2a969c1672c0be9126f18ec3f439dd3e58875023e733e5f2ae7c5cb839d9

Observation c4a3b13a-206f-4367-8b78-c5c51632f429 · outbound

This paper cites S2ft: Efficient, scalable and generalizable llm fine-tuning by structured sparsity.

Advantageous Parameter Expansion Training Makes Better Large Language Models S2ft: Efficient, scalable and generalizable llm fine-tuning by structured sparsity

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:06.222422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:01.342708Z digest=sha256:bab8513c506f83178300273d9a9ae64b6d1aa6cc02365839e0d5a35f8ed512e7

Observation 16cc2191-c65c-4366-ba84-f2f699844d43 · outbound

This paper cites Tinyllama: An open-source small language model, 2024.

Advantageous Parameter Expansion Training Makes Better Large Language Models Tinyllama: An open-source small language model, 2024

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:01.460218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:01.460218Z digest=sha256:a238d9783318b92367e5dc979e86c95373238a10a9fb776a80852d38085010c5

Observation f4fed23d-1319-4957-b585-2b5006bb67d3 · outbound

This paper cites Redpajama: an open dataset for training large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models Redpajama: an open dataset for training large language models

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:06.149961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:01.569207Z digest=sha256:81391eb2da6738703563a838368173533f421954b08dff54a03108ff7cc94457

Observation 0847a323-50ac-4a9d-937e-84d0acea18d9 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Advantageous Parameter Expansion Training Makes Better Large Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:01.681225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:01.681225Z digest=sha256:2d1f40bde470fef3a46045a8f93b0e259fd64cd998800582c4209c219d5a6366

Observation eb685274-3caf-4b20-9d74-0e8c70897eda · outbound

This paper cites The LAMBADA dataset: Word prediction requiring a broad discourse context.

Advantageous Parameter Expansion Training Makes Better Large Language Models The LAMBADA dataset: Word prediction requiring a broad discourse context

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:01.791886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:01.791886Z digest=sha256:254a056bbf636e89c7ee85f4427d4eeea62a4b537679ab1a037fb4f4242e9ca7

Observation fd506fb8-9f57-4aa0-a05e-d85de6cee7d4 · outbound

This paper cites LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning.

Advantageous Parameter Expansion Training Makes Better Large Language Models LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:01.860011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:01.860011Z digest=sha256:2952211264158277c2be8ca9d5b867597cf8cd5a7090bc389e04430435986bc1

Observation d9d8875b-f698-4f93-90b4-436eee36fbe0 · outbound

This paper cites PIQA: reasoning about physical commonsense in natural language.

Advantageous Parameter Expansion Training Makes Better Large Language Models PIQA: reasoning about physical commonsense in natural language

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:06.045296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:01.968858Z digest=sha256:face2fcaa66f68329238be626926ee9e0ac014aa93a4d33f3adea370d010d98f

Observation b084aeb5-8f4f-46e9-ba5d-ba4a173d4eea · outbound

This paper cites Liu, and Matt Gardner.

Advantageous Parameter Expansion Training Makes Better Large Language Models Liu, and Matt Gardner

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:02.070662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:02.070662Z digest=sha256:02af2a7c4dec660478b4051497f66ff75ec27737931274e156b18f3922c43a24

Observation e6d28d96-1c89-4f0f-a250-ae643ed8d2fc · outbound

This paper cites Winogrande: An adversarial winograd schema challenge at scale.

Advantageous Parameter Expansion Training Makes Better Large Language Models Winogrande: An adversarial winograd schema challenge at scale

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:02.148445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:02.148445Z digest=sha256:62f0f0f69f506f7544f2bc12a156dc4cac9da5f549993c145ecc9b5c143c311b

Observation 88d4196c-f627-4690-955e-02b5f362d57b · outbound

This paper cites Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R.

Advantageous Parameter Expansion Training Makes Better Large Language Models Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.937552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.254474Z digest=sha256:35ffcf9be3900c349d26e090279bd6607d4437a08f76eb9e98ddc5d8552b5813

Observation cb37b043-42b9-40fc-b629-463701300ea5 · outbound

This paper cites Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming-Wei Chang, Andrew M.

Advantageous Parameter Expansion Training Makes Better Large Language Models Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming-Wei Chang, Andrew M

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.828632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.366029Z digest=sha256:72a8c2acf4ae2f2d3ba9c45b15833671bee15793e4bacd76e9e2950615d5fce1

Observation f5c64eae-1e07-464e-bb4f-a00198043064 · outbound

This paper cites Learning to grow pretrained models for efficient transformer training.

Advantageous Parameter Expansion Training Makes Better Large Language Models Learning to grow pretrained models for efficient transformer training

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.725310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.464462Z digest=sha256:181b669a50490694edde8bffe5f7274a63fcb53302553c6c550847d716ebc1f8

Observation edaeab5a-93e2-42ac-9b31-451cc37f11f8 · outbound

This paper cites Scaling smart: Accelerating large language model pre-training with small model initialization, 2024.

Advantageous Parameter Expansion Training Makes Better Large Language Models Scaling smart: Accelerating large language model pre-training with small model initialization, 2024

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.585053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.551364Z digest=sha256:5ca93474338d726975ba70a473c89bb4c62924071c83d777d3f01f03761f003e

Observation 598d78ce-bc8f-4b66-815c-ed79b1be4e7a · outbound

This paper cites LoRA: Low-rank adaptation of large language models.

Advantageous Parameter Expansion Training Makes Better Large Language Models LoRA: Low-rank adaptation of large language models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:02.641265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:02.641265Z digest=sha256:445eef553cb10b6d0f00115b26d1324b1aa2c2af89f304c612fbd3f72812d541

Observation 0ea1ddef-4d6d-4ab5-b4cf-47c4f6b43f7b · outbound

This paper cites Parameter-efficient transfer learning with diff pruning.

Advantageous Parameter Expansion Training Makes Better Large Language Models Parameter-efficient transfer learning with diff pruning

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.442392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.733634Z digest=sha256:aa4d874f808731f62ab9d681c082604d152014accb8af0a530fe1f7229670dc8

Observation 75f589f9-b90d-4873-a779-047b624455da · outbound

This paper cites Training neural networks with fixed sparse masks.

Advantageous Parameter Expansion Training Makes Better Large Language Models Training neural networks with fixed sparse masks

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.310344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.819550Z digest=sha256:882de5f588c85abb351c12b8f6fb5fd783d305719461313a587838ecc290a264

Observation 093b258c-5123-43bb-9923-a5fa2272b0d5 · outbound

This paper cites LoRAMoE: Alleviating world knowledge forgetting in large language models via MoE-style plugin.

Advantageous Parameter Expansion Training Makes Better Large Language Models LoRAMoE: Alleviating world knowledge forgetting in large language models via MoE-style plugin

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.178736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:02.916562Z digest=sha256:1edc95d2af2f0250572dd4d6c1b1b0a9801321e1c7452ae38d0ffe0090bd653e

Observation 1e9fb02a-8604-4f43-96d7-2373da49bb66 · outbound

This paper cites Open llm leaderboard v2.

Advantageous Parameter Expansion Training Makes Better Large Language Models Open llm leaderboard v2

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.008625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.008625Z digest=sha256:5bb5ff9767e5eaf54d89fa75db2b070db11ed8ab4bc3ffb6a7ab27753e786497

Observation 60bab649-cf82-4e8e-b539-38e4d438d58f · outbound

This paper cites Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V.

Advantageous Parameter Expansion Training Makes Better Large Language Models Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.074193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.074193Z digest=sha256:7fb93789193de3a4ed020abea71076eb397722af0dbec54117fb48ddd779a0b7

Observation b744294a-9da6-412b-82d9-a1c3ef8ee8b8 · outbound

This paper cites Openassistant conversations – democratizing large language model alignment, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Openassistant conversations – democratizing large language model alignment, 2023

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.145796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.145796Z digest=sha256:c76f417e30930cbe10cb884ad7086033219f45c56167c201d02db590aaeb9f5e

Observation d59716fd-d1ed-4e31-bf53-d803417fc55e · outbound

This paper cites Instruction tuning with gpt-4, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Instruction tuning with gpt-4, 2023

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.223776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.223776Z digest=sha256:ecfbac767411b2f20c4fbb3d5e88c80c103d7c7d84e3449cfd187f60a1a49c40

Observation 24e2876f-de3c-43f0-9dae-195d802dab98 · outbound

This paper cites Code alpaca: An instruction-following llama model for code generation.

Advantageous Parameter Expansion Training Makes Better Large Language Models Code alpaca: An instruction-following llama model for code generation

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.322828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.322828Z digest=sha256:5b9c1562444be4292e80b829d6762b456b353ae725929919bdda4aa9228e3c4e

Observation 01fe5386-62ca-40ef-82a2-07f015d92e28 · outbound

This paper cites Lima: Less is more for alignment, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Lima: Less is more for alignment, 2023

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.414462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.414462Z digest=sha256:534533a9528d48eb4284bdf4fcd898714326521f9b0f2b098876c5a326a46a45

Observation b11bd313-5788-401a-9f0f-e01ad6493522 · outbound

This paper cites Wizardlm: Empowering large language models to follow complex instructions, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Wizardlm: Empowering large language models to follow complex instructions, 2023

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:05.021454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:03.506893Z digest=sha256:bdd9c088d5ce9b8657a7c3e14d76cfb06be80c977ea0f5575ced5f7ef4b36931

Observation 606314cf-158d-4628-8818-55b540c64291 · outbound

This paper cites Orca: Progressive learning from complex explanation traces of gpt-4, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Orca: Progressive learning from complex explanation traces of gpt-4, 2023

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.573739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.573739Z digest=sha256:46e58c242678a1ed1dce9afe4c6288320ffd214847e4df4ebdeacfe3d9449a6f

Observation d5b397c3-3d60-4168-8ae1-d4814a079de6 · outbound

This paper cites LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models.

Advantageous Parameter Expansion Training Makes Better Large Language Models LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T12:36:03.689722Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:36:03.689722Z digest=sha256:6a9e8999cc5a48872412164d674b4d1a38bd8746ededb83f76c45d4fd29daced

Observation 7eeb2cf9-8b95-4754-a4be-b9ba879c25bd · outbound

This paper cites composer.https://github.com/mosaicml/composer/, 2021.

Advantageous Parameter Expansion Training Makes Better Large Language Models composer.https://github.com/mosaicml/composer/, 2021

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:04.853208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:03.756912Z digest=sha256:f7c8fc8e63324f6741ca360f5af1a2d522033a67307f406f4447ccf9187d401a

Observation 68637e74-e185-4a2e-befc-228cd5ccc64e · outbound

This paper cites Pythia: A suite for analyzing large language models across training and scaling, 2023.

Advantageous Parameter Expansion Training Makes Better Large Language Models Pythia: A suite for analyzing large language models across training and scaling, 2023

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:04.711088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:03.873182Z digest=sha256:c05543df4e268f26ee2df60c40c28a733f700b48eea4be6f6663c6acf79045bb

Observation 474f2d64-e64a-4264-9ded-cb63ac899a0a · outbound

This paper cites The language model evaluation harness, 07 2024.

Advantageous Parameter Expansion Training Makes Better Large Language Models The language model evaluation harness, 07 2024

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:04.518059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:04.002718Z digest=sha256:e518981394361972a3c1e62ef64ebb7447f25dde1c4e3ade46995a1222dba59b

Observation e1820a5a-e5ab-4162-81b9-bf11f68c613d · outbound

This paper cites [68], we fine-tune them for 3 epochs.

Advantageous Parameter Expansion Training Makes Better Large Language Models [68], we fine-tune them for 3 epochs

Reference 8192

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:36:04.368810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T12:36:04.095237Z digest=sha256:daac9b83141a3c7ab81777ee98d48432d10eaeef36eb8ccfbbfdcfe9c9ebb540

Pith citing papers

No inbound Pith citation observations are available.