Pith. sign in

Paper Citation Record · LEDGER

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

As of 6 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.04969.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.04969 v1

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T10:45:46.618668Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

20 of 20 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 0a1d000a-3215-432f-be92-848e41b96587 · outbound

This paper cites Phi-4 Technical Report.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Phi-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:08636eccd5587c23b5f7318f5798a3d833625a5bd5386572da58a2f759c5e7d2

Observation 21cff844-1be4-4e10-bcde-fd3fc1f8428f · outbound

This paper cites SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:f877912d4dc50f4b135ef44f30c9438cae96c9c105dc9af8d6e5617b1f53689a

Observation 57b7f3bd-d63e-46e9-8f64-c6b2c8044616 · outbound

This paper cites Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:a489c61c435048c06c32f129de1339594992e33c3d8161eda8efc78732fc6f67

Observation ac4162bd-e12c-4948-a030-39ba601e5c8c · outbound

This paper cites Reformulation for Pretraining Data Augmentation.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Reformulation for Pretraining Data Augmentation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:10a0fff75b2e95d8676cd500e39e5c6eff8b614350b105b41c875cf329b7f3bc

Observation 0f37e195-1eca-4716-a8b1-1c6d23669b05 · outbound

This paper cites Scaling Laws and Interpretability of Learning from Repeated Data.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Scaling Laws and Interpretability of Learning from Repeated Data

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:d6343aec071000c2af322e5b7efa8f5e24394497ef79a30b1f3bb3d6b23457c9

Observation 0736a376-dae2-4317-820f-6f4f87747bc7 · outbound

This paper cites Training Compute-Optimal Large Language Models.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Training Compute-Optimal Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:143b90b0729fba7b397e53f81cd7cf57b2d162a67ab2577d91c2abdef9c1e6fa

Observation e364a06c-7f2d-4cab-aeaf-bc5df9d406ab · outbound

This paper cites Ultra-Sparse Memory Network.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Ultra-Sparse Memory Network

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:11f5ca0c77d0880fdbdafb80a3b99a41b4f36ba8d7e96eab61c9ad91024592bf

Observation 5b965e8a-d04d-415a-a662-6fe5946470a2 · outbound

This paper cites Ziyue Li, Chenrui Fan, and Tianyi Zhou.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Ziyue Li, Chenrui Fan, and Tianyi Zhou

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:a4800d2ab040d1b1ccb797c4f800bb8ca34afdebed0f4af8d258b3bbb8225e3f

Observation d0dfc0bd-c81c-49e7-a214-27aa69869332 · outbound

This paper cites Let's Verify Step by Step.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Let's Verify Step by Step

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:8112472ff4bbf546800befa8e1fdfd9dd4e3dd1125fb5aed98aa1ff5b7f2a680

Observation 7ddfe9df-2dac-499f-83e3-0f48e186728f · outbound

This paper cites How much do language models memorize?.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training How much do language models memorize?

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:ed3ff53c482f9d3391c9e1e067d61a3038fb26f43285d74e735bd6d0fef9c457

Observation 016b0d27-4f1c-4fdf-9077-d0a313695566 · outbound

This paper cites Olmo 3.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Olmo 3

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:88271a60df1231bb47421fb86b360411ee799c93ad1d251dd9c5bcd6934db472

Observation 5fb69b54-f28c-4bea-95ec-b9069f16e924 · outbound

This paper cites Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:aa7e14aeb0825decd59866214bfee40a04dcaaf18cb38e62eb121a7577447e60

Observation 9d5df397-5493-4268-bdaa-aa093e709d94 · outbound

This paper cites The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:5b755388b523c2b6ad73693fa85a5e4615b8c692bd73e4d1bc3c6492dbabfe5d

Observation 9f79dfb9-1d36-46f9-a59d-b50b33d7fb36 · outbound

This paper cites Galactica: A Large Language Model for Science.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Galactica: A Large Language Model for Science

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:2ad0048dbeb78ca250bf2e78a0f4e6c771ed92a7ca9af1bacbe31212ddf52ec3

Observation c2f585ae-f956-40fb-ba97-e8247b0a8355 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Kimi K2: Open Agentic Intelligence

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:3ef31c84502af859f8668b11917c1b18fc9a534f89475805772c2b35c3930c31

Observation 72e0f637-ddf4-4168-bb56-6415d1dfcb4d · outbound

This paper cites OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:e9a5a751671173bc3c061bd4740c38168b49911de7b2dacd7b000d0211f2da45

Observation 10a4e715-c655-4ca4-aee8-55fcf3ac4764 · outbound

This paper cites Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:04250013c30753033d23d59ec7b638c77e8e0ee2bdd72b79c302de77d8740bb1

Observation d13ccbe8-d9a3-40c6-90d6-4c078dd88cd3 · outbound

This paper cites Larger datasets can be repeated more: A theoretical analysis of multi-epoch scaling in linear regression.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Larger datasets can be repeated more: A theoretical analysis of multi-epoch scaling in linear regression

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:a2e3816670ee06947c4032c5f9ee36e14c3667682d0011b4e26fbc5d7f685e4e

Observation 920c41c3-595b-4484-8567-053d0cb39d89 · outbound

This paper cites Nicolas Zucchet, Francesco d’Angelo, Andrew K Lampinen, and Stephanie CY Chan.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Nicolas Zucchet, Francesco d’Angelo, Andrew K Lampinen, and Stephanie CY Chan

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:376ecdd594beae375427b6ba6e5e674290c6435a52f5d9005637334c00e578c7

Observation dff1143d-d849-420a-9631-c9316323ac43 · outbound

This paper cites Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance.

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-11T10:45:46.618668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T10:45:46.618668Z digest=sha256:c7fec3e4348c15e526c74c313e70e8b428c8ac02d9cc6b1c97815c9175d783cf

Pith citing papers

No inbound Pith citation observations are available.