{"as_of":"2026-08-08T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d86cba66168dd116fe4f34bd78270c11e5c3fbc52e8d9a0ca9ad5607fbac2a7","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:22.360806Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:01:21.521025Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:04:56.636609Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"cited_work":{"arxiv_id":"2505.19051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19051","snapshot_observed_at":"2026-06-30T17:04:56.636609Z","title":"Sung Min Park, Kristian Georgiev, Andrew Ilyas, Guillaume Leclerc, and Aleksander Madry","venue":null,"work_id":"18483297-0505-4f6f-a8e0-11b77a75bd6b","year":null},"citing_paper":{"arxiv_id":"2605.21422","last_updated":"2026-06-01T04:58:51Z","snapshot_observed_at":"2026-07-06T23:31:51.443407Z","submitted_at":"2026-05-20T17:15:43Z","title":"PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T17:01:21.521025Z"},"links":{"cited_paper":"/paper/2505.19051","citing_paper":"/paper/2605.21422"},"observation_digest":"sha256:4b9efbe25fc497e29ed7831ba23fdba18b53356f04397fde8356334ac21abd94","observation_id":"ec243924-b070-4a3b-9b1b-9e31b51376e3","resolution":{"observed_at":"2026-06-30T17:04:56.638213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19051/citation-record","integrity":"/paper/2505.19051/integrity","json":"/paper/2505.19051/citation-record.json","paper":"/paper/2505.19051"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-07T17:47:02.067367Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-07T14:25:17.393085Z","title":"Less: Selecting influential data for targeted instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:17.393085Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d6929096c8b1db58cfd9b62fe4a72c419232ce6a59e86080cd63e504ecd33cad","observation_id":"8fbc55e1-4d0d-4961-b324-4f89de4aa9fe","resolution":{"observed_at":"2026-08-07T14:25:17.393085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16208","last_updated":"2025-04-07T18:16:42Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:11:21Z","title":"Compute-Constrained Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16208","snapshot_observed_at":"2026-08-07T14:25:17.780704Z","title":"Compute-constrained data selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:17.780704Z"},"links":{"cited_paper":"/paper/2410.16208","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:2e0a400ee1d0d4440ba90e6520a88fd9a929c53c5fd4e2be045a9c94c7726a7a","observation_id":"3d6ef85e-3975-4139-be2b-80015db191cc","resolution":{"observed_at":"2026-08-07T14:25:17.780704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00175","last_updated":"2022-05-19T22:49:00Z","snapshot_observed_at":"2026-08-07T22:50:41.473161Z","submitted_at":"2020-05-01T02:01:18Z","title":"Selecting Informative Contexts Improves Language Model Finetuning","version":3},"cited_work":{"arxiv_id":"2005.00175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.00175","snapshot_observed_at":"2026-08-07T14:25:23.396552Z","title":"Selecting Informative Contexts Improves Language Model Finetuning","venue":"cs.CL","work_id":"f3cfe3a8-8f1c-4ac2-b326-2aa97b00f250","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:17.896261Z"},"links":{"cited_paper":"/paper/2005.00175","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:7a8afdb365c3d2cbcb5d9a84733634a722eb98a15e96d8dedbcc98914ba55cca","observation_id":"f876d2a2-41fd-4918-908b-e958932f7cad","resolution":{"observed_at":"2026-08-07T14:25:23.404674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-07T03:50:04.516601Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T14:25:18.051571Z","title":"When less is more: Investigating data pruning for pretraining llms at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.051571Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:06688a3c8f15b6b7c1c2d43b0b58e57d3b67f8d4c1da5960b8a804981f0187ee","observation_id":"d619e2ab-6886-44f8-9a45-7f500f198bcc","resolution":{"observed_at":"2026-08-07T14:25:18.051571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-07-06T18:23:05.893052Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-07T14:25:18.158554Z","title":"Perplexed by perplexity: Perplexity-based data pruning with small reference models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.158554Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cc8726e5a37090411460cdbd0d7a7fa33c669b14472c9c7c13843c383d783501","observation_id":"19b78a8c-059c-4d4e-a570-b9b7eac4fa33","resolution":{"observed_at":"2026-08-07T14:25:18.158554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-08-07T14:25:18.225316Z","title":"From quantity to quality: Boosting llm performance with self-guided data selection for instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.225316Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:561f0c7260a0feb396f39f6ea2397ff45d6968ed7aeebd002c731397223735f9","observation_id":"21e7f305-db1c-408e-8639-e83c44e0de5f","resolution":{"observed_at":"2026-08-07T14:25:18.225316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01807","last_updated":"2025-06-19T04:19:15Z","snapshot_observed_at":"2026-08-08T01:22:30.771699Z","submitted_at":"2025-03-03T18:37:26Z","title":"Large-Scale Data Selection for Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01807","snapshot_observed_at":"2026-08-07T14:25:18.318477Z","title":"Large-scale data selection for instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.318477Z"},"links":{"cited_paper":"/paper/2503.01807","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:59ea5d2f9bfb3c09e7162460565dd3b2aef15e2c62dbb1208c0d7ad980f2a1f1","observation_id":"1842ce34-e2e5-4790-8ad3-bdc80f01ace0","resolution":{"observed_at":"2026-08-07T14:25:18.318477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.092650Z","title":"Woodruff, and Michael Wunder","venue":null,"work_id":"96ede5f9-41aa-4517-878f-49e8a04db53d","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.411049Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:916088dbd1f0654b75887012640bf9f20c144b4243785f344de237afff9ea920","observation_id":"79ee8196-a446-4fcb-9266-7f377ae89de4","resolution":{"observed_at":"2026-08-07T14:25:24.098253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.072328Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"8cc5da86-d0a4-482e-88a5-e4a3bcbc04be","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.509368Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:64b0f7d98cd99b1e8cb6fa8d3a3a994d3c01bcc50f6bf7ad35d7cac72075ba1b","observation_id":"60b8b8ae-e7a5-4c03-bf9d-c1d4aa4238b1","resolution":{"observed_at":"2026-08-07T14:25:24.078640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T14:25:18.604677Z","title":"Dsdm: Model-aware dataset selection with datamodels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.604677Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:9dc5f61b86f8e0a34e2e7920edf1e4f8263f86836fd45a1c0968f04c2b147ffd","observation_id":"bb7a900b-430a-47e6-9e52-c239a7a5ec99","resolution":{"observed_at":"2026-08-07T14:25:18.604677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.051526Z","title":"Dynimpt: A dynamic data selection method for improving model training efficiency","venue":null,"work_id":"ce25f67e-d2f8-4138-83bb-711960425dc5","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.700224Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:c57125f0884b38e6fac84a8b67e1bcbfd7b399d43cf2821ab32f4b812d452376","observation_id":"b5eec917-9062-45a4-bfdc-781b790f61e1","resolution":{"observed_at":"2026-08-07T14:25:24.058162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:25:18.771868Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.771868Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d51eb5a7742c28d8395fa20b626228f85b2234a541ae3e4cb539afb795471f50","observation_id":"11e1d17c-c31b-4f87-8cb3-e328be64f6f9","resolution":{"observed_at":"2026-08-07T14:25:18.771868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-07-06T16:49:08.648847Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-07T14:25:18.851073Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.851073Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:caf7d2eb5aa82d5d4464156a9a561206a8adbdd43ce4f5d38e4ee6815f463b37","observation_id":"0463f96f-69bc-4ecb-a1b0-d5d34f434f28","resolution":{"observed_at":"2026-08-07T14:25:18.851073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:25:18.919852Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.919852Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:9b18e9246a98f1fbe0eb4337c10096dde753ad5735127be111f13550d611eb1f","observation_id":"f4790058-ee55-4ed6-955b-52cba7aa5027","resolution":{"observed_at":"2026-08-07T14:25:18.919852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.036128Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.036128Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:437413a3923f8889c04dca28072bd744830fba9dd5baa70decd853eb0a8d11f3","observation_id":"eb35e51a-e430-4238-b334-dcf3b50017d4","resolution":{"observed_at":"2026-08-07T14:25:19.036128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.100480Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.100480Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d23331f772fc884b443ad75d3aac8f2f09d819e61bb282f1fe2fc76ddc6e8818","observation_id":"befea17d-e1d9-4c00-a113-d58a9d298519","resolution":{"observed_at":"2026-08-07T14:25:19.100480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.010140Z","title":"Aligning ai with shared human values","venue":null,"work_id":"d879f8c8-61b5-47a5-bde0-910421c998d0","year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.172914Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:61a22d9caceeb9b47a0ebe05d6ea056e957ad71d9cd999b06704a6af99fbe3dc","observation_id":"fcdb9fb3-9c3f-40f1-b9db-e891da515fbe","resolution":{"observed_at":"2026-08-07T14:25:24.015581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.244702Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.244702Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:31d355cfac3415d4e34610d683cf82b57d5b7241b28ce5cb8a151756e17b3cba","observation_id":"bb3c6ee3-5dc6-4280-99c3-324731caf66f","resolution":{"observed_at":"2026-08-07T14:25:19.244702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-07T14:25:19.312719Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.312719Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:02f1b854cf176f8ad13754443323638374199e1ca82ae808b0ff9b501085ebb9","observation_id":"d5a8c5d7-e961-4745-875f-389ced08038f","resolution":{"observed_at":"2026-08-07T14:25:19.312719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.977705Z","title":"Cross-lingual transfer learning with data selection for large-scale spoken language understanding","venue":null,"work_id":"94ca2c3b-75b1-416f-85f4-b593903e82bc","year":2019},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.379256Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:37ad1ea460c09f6a64c5854e25a54ef477cb7bc9bfc551eb117b9b830f6a4aab","observation_id":"88d799a2-6e30-40e3-81b2-49fab40ddd1c","resolution":{"observed_at":"2026-08-07T14:25:23.983540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.955371Z","title":"Smalltolarge (s2l): Scalable data selection for fine-tuning large language models by summarizing training loss trajectories of small models","venue":null,"work_id":"a2c29af2-7e18-47bb-9ce7-6f0e0d8eca4b","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.453517Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:a95e6b3d8dceec9ce76a1fd7a3b06c76fc5e61370e55398fab369da48a321fc4","observation_id":"a41bb63b-5888-4361-84d8-82c8b50b1045","resolution":{"observed_at":"2026-08-07T14:25:23.965627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T14:25:19.525244Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.525244Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:3be87a2b8e079a9b1b121af23aa700f7e3ca20511e55756f6deadacac23cd6ba","observation_id":"f361fb2b-cf34-40e7-b9cd-9725d3e3ad4a","resolution":{"observed_at":"2026-08-07T14:25:19.525244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T14:25:19.604099Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.604099Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cf2a436a4d28c7045b68009ddecda80503eed59e5b1f27720fdbc0ffd7342494","observation_id":"00ac99af-f005-4de7-b4c8-10b652dab6c2","resolution":{"observed_at":"2026-08-07T14:25:19.604099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.673561Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.673561Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:0d72e86568bfc22bf5afa2f82bf3c19a29d2217558a1182128b26e23c79a222a","observation_id":"a73e737e-1a7e-436f-821b-970c7579f6ed","resolution":{"observed_at":"2026-08-07T14:25:19.673561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.923465Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"7362c1e0-027b-4022-9011-0012f43d660a","year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.745460Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:9578b77e252980ae54d7223684ada92024dc6eab6921de6d47a43f08cf12f2f1","observation_id":"82471f86-8c9e-4aea-8eba-95d0d6fb6a6a","resolution":{"observed_at":"2026-08-07T14:25:23.929603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.906600Z","title":"Intelligent selection of language model training data","venue":null,"work_id":"0a7cecfc-7626-4660-8fd7-233abec77264","year":2010},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.818399Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:e47063b463b43f005d0afd585f4c8851aa7428276705a5bcb70bc5ef977df876","observation_id":"2bfb858c-ab44-4093-b67f-c1f624d15e86","resolution":{"observed_at":"2026-08-07T14:25:23.911761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.02279","last_updated":"2017-09-07T14:30:50Z","snapshot_observed_at":"2026-07-06T05:58:35.047727Z","submitted_at":"2017-09-07T14:30:50Z","title":"Cynical Selection of Language Model Training Data","version":1},"cited_work":{"arxiv_id":"1709.02279","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.02279","snapshot_observed_at":"2026-08-07T14:25:23.136208Z","title":"Cynical Selection of Language Model Training Data","venue":"cs.CL","work_id":"9d634d69-bea4-429b-a0bc-0b1934f0e306","year":2017},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.882220Z"},"links":{"cited_paper":"/paper/1709.02279","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:361d348a331f69b7c4aa6bdf8dfff5853a4aab220fcfbd0b76b04eae25d0c49e","observation_id":"c452aa61-e1e1-4d88-b0e2-234b48fdb01e","resolution":{"observed_at":"2026-08-07T14:25:23.141447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10951","last_updated":"2022-10-26T01:05:51Z","snapshot_observed_at":"2026-07-06T14:07:58.832663Z","submitted_at":"2022-10-20T01:45:02Z","title":"Automatic Document Selection for Efficient Encoder Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10951","snapshot_observed_at":"2026-08-07T14:25:20.012070Z","title":"Automatic document selection for efficient encoder pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.012070Z"},"links":{"cited_paper":"/paper/2210.10951","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d775722afa49b813125713e7e5043cbeca9af61bbcfa1503fadc3c27c5eecbda","observation_id":"5a7ade20-0521-4473-bff6-3c1bb2bab8a8","resolution":{"observed_at":"2026-08-07T14:25:20.012070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.084156Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.084156Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6a9ab7cf398325bf8223f31d5d93a09e735b2321d7a052be6fb89cc53a5336c5","observation_id":"7690d485-e810-4b73-9afc-bf3a14ecad51","resolution":{"observed_at":"2026-08-07T14:25:20.084156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.877009Z","title":"Skill-it! a data-driven skills framework for understanding and training language models","venue":null,"work_id":"16013488-c0c0-4028-86a7-7d6672caeab4","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.166474Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cc5ec22930a159d385c2ab1bd0d68043c0a068d049ecd765a66937f878fbb136","observation_id":"a9e3bc3b-a137-4acd-8a29-5540a37335c8","resolution":{"observed_at":"2026-08-07T14:25:23.883126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.852294Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":"f39f983e-9c88-4022-a418-cd368b1750a6","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.269168Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:7e799de9f46ae646ad98d282365fd11fbf35ad39c7ee0cb51f4941839fcb5751","observation_id":"0f8af9a2-3458-4764-aeb1-601c3b23e6f8","resolution":{"observed_at":"2026-08-07T14:25:23.858137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13008","last_updated":"2024-12-19T02:54:42Z","snapshot_observed_at":"2026-08-07T06:44:57.274727Z","submitted_at":"2023-10-16T07:26:24Z","title":"DavIR: Data Selection via Implicit Reward for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13008","snapshot_observed_at":"2026-08-07T14:25:20.358301Z","title":"Lobass: Gauging learnability in supervised fine-tuning data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.358301Z"},"links":{"cited_paper":"/paper/2310.13008","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:00883ef13077b876a739d01987d3ce26fd1419ecf7894f6fbcff9487213f6ae7","observation_id":"9d30b2e6-7b81-498c-8c6b-2ded60bc6076","resolution":{"observed_at":"2026-08-07T14:25:20.358301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.827112Z","title":"Dataset cartography: Mapping and diagnosing datasets with training dynamics","venue":null,"work_id":"07a22b3f-6afa-46e8-b315-f9148b4229ac","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.437538Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6bd918e59b0d5493bab01ad6f86eb27272445ea69cbf8214ec13e0efe3edeb8e","observation_id":"29860640-ff21-4f63-ab10-007a95bad28e","resolution":{"observed_at":"2026-08-07T14:25:23.834143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06692","last_updated":"2024-07-08T02:52:05Z","snapshot_observed_at":"2026-07-06T17:14:53.706063Z","submitted_at":"2024-01-12T16:56:54Z","title":"An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06692","snapshot_observed_at":"2026-08-07T14:25:20.521520Z","title":"An experimental design framework for label-efficient supervised finetuning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.521520Z"},"links":{"cited_paper":"/paper/2401.06692","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d51e02b74a85f98463c181efb60dcb29ad8bc45ea5e854fa8b4ca928168d2777","observation_id":"17ea860b-5e66-4673-a0b5-82171a40dc6a","resolution":{"observed_at":"2026-08-07T14:25:20.521520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.803357Z","title":"D4: improving LLM pretraining via document de-duplication and diversification","venue":null,"work_id":"266566b7-d449-4840-b3bb-f052baf09b3a","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.741486Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:46595ea3df48699ccd08354b7069fb1c397767ad424b8304463ca2a1b8ace9c2","observation_id":"e924ecee-3e7c-4541-92d8-d6c7929fd640","resolution":{"observed_at":"2026-08-07T14:25:23.808786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.781534Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":"91050df8-43eb-4c08-ba8a-f76144fa342a","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.901391Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:ece131f4fa51c4c9bc86acb5608fe160e7c416532a3177b6883363976297df17","observation_id":"474777d3-2037-4e4a-b396-c0df17e86390","resolution":{"observed_at":"2026-08-07T14:25:23.788444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.760512Z","title":"Learning from less data: A unified data subset selection and active learning framework for computer vision","venue":null,"work_id":"ff3ad466-9e18-4d1a-9130-0bd61ec92c8b","year":2019},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.067871Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5ab8c285fe20df3bdf862b34a9e73a26c10df60f5dd9de9c727e6d5fba50a474","observation_id":"d87a0e1b-bd04-4182-a1aa-25df599736f9","resolution":{"observed_at":"2026-08-07T14:25:23.766973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.724917Z","title":"Retrieve: Coreset selection for efficient and robust semi-supervised learning","venue":null,"work_id":"5634bca0-b57a-41d6-9cc0-8eb234b30452","year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.234618Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4421963e08cfba0cb25571cf23dbbf2660c5f6b4bb5d353e0de8b5e0d4a9bd1f","observation_id":"8c036948-b5b7-4b01-80f2-b7226ffdb001","resolution":{"observed_at":"2026-08-07T14:25:23.735817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.696960Z","title":"Submodularity in data subset selection and active learning","venue":null,"work_id":"b6807ca0-df59-4bf4-a564-227f0ca6655c","year":1954},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.361747Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:06b4693877f486c6d6ad99ad6d5b375eba275e19ac48bc3501eb564301654cd8","observation_id":"5533b5e1-4487-4a27-967c-91930106f009","resolution":{"observed_at":"2026-08-07T14:25:23.709866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-07T14:25:21.398721Z","title":"Alpagasus: Training a better alpaca with fewer data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.398721Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6767d3dbb0dea41382008ea6233e47ccd38445633caddbe754fda4d52039e1b7","observation_id":"99c9d33d-1de1-48fa-897f-013f850ee489","resolution":{"observed_at":"2026-08-07T14:25:21.398721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06290","last_updated":"2024-07-26T18:09:11Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:37:31Z","title":"Instruction Mining: Instruction Data Selection for Tuning Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06290","snapshot_observed_at":"2026-08-07T14:25:21.464252Z","title":"Instruction mining: Instruction data selection for tuning large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.464252Z"},"links":{"cited_paper":"/paper/2307.06290","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:8cfa6a95b42dc597861d17899ed017cee9c947e2cc0269f1adbd09d58dfd99b5","observation_id":"4553c525-29a0-4827-8eaf-0364a95e7b86","resolution":{"observed_at":"2026-08-07T14:25:21.464252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00489","last_updated":"2018-06-01T10:17:23Z","snapshot_observed_at":"2026-07-06T05:53:39.440274Z","submitted_at":"2017-08-01T19:50:53Z","title":"Active Learning for Convolutional Neural Networks: A Core-Set Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.00489","snapshot_observed_at":"2026-08-07T14:25:21.747454Z","title":"Active learning for convolutional neural networks: A core-set approach","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.747454Z"},"links":{"cited_paper":"/paper/1708.00489","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:92aa1a05fd7eaa677914be9a46f9e00e2c906d8939287f317b5c81257eadb881","observation_id":"9427bd11-8fc2-4a97-a465-12efbb58d1fd","resolution":{"observed_at":"2026-08-07T14:25:21.747454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.789613Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.789613Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:8175698236072ebf56efcd93009326cc315bde6da3a96fd8b6adeb3931e39056","observation_id":"065bb8c1-8daf-4f54-84ed-cbfac5366862","resolution":{"observed_at":"2026-08-07T14:25:21.789613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.660128Z","title":"A software package for sequential quadratic programming","venue":null,"work_id":"1cd960ba-0642-4397-af5b-9f3a035cfc14","year":1988},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.870108Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:c5e8d1a65e2beb2954bcd1548cc91ee4321ca0ee05c307926f021a16011e75e6","observation_id":"9df2c883-9405-4900-8f21-f08980d7e081","resolution":{"observed_at":"2026-08-07T14:25:23.666379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.638252Z","title":"Fundamental algorithms for scientific computing in python and scipy 1.0 contributors","venue":null,"work_id":"c35fda3d-2823-4504-bef9-1e3d58e67f53","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.961637Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:631a27bf3b723e170eb9ea824a7d1a82fd7b9863f7b18d5f878be0046501931d","observation_id":"c5fb7ade-f1d3-47db-8a18-55d965c6d369","resolution":{"observed_at":"2026-08-07T14:25:23.646276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:25:22.030590Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.030590Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1c841a0e1af775313840ebe63cccb9c190b57ea15b70d5198ff2b7db872fe5d4","observation_id":"ac74536e-43cd-47ae-a685-e1c856b6fd0b","resolution":{"observed_at":"2026-08-07T14:25:22.030590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:25:22.093676Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.093676Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d084e3afc9d229cbd5e6645e0e54452fe9299fbbcc6295eca1ba5a56463075ac","observation_id":"0cb541b8-9d92-4626-a4e5-89ebb8074ab1","resolution":{"observed_at":"2026-08-07T14:25:22.093676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-07T14:25:22.179177Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.179177Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:2fbb32db602a0cdbcff01fe64e2c3a462a66e8e97a7b7ee60ede26c5d4b1edc4","observation_id":"6fe5a871-a5ab-4ff0-94f1-476304d1d5d2","resolution":{"observed_at":"2026-08-07T14:25:22.179177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.621127Z","title":"Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki","venue":null,"work_id":"aecfb686-68d5-4d57-8742-359dd225c478","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.229023Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1992266b1ee916364687f041de9d33629cba1fcb92432ff1b46f82a6ac99a67c","observation_id":"32472503-e5aa-4826-985e-446ce7b0347a","resolution":{"observed_at":"2026-08-07T14:25:23.626327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:25:22.234458Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.234458Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cc5ad6b24685024f6a309911f422ba88e346cd3c40aefbacda267617098a9e49","observation_id":"afb0ea76-2f23-4533-8c7d-5f4df29d6fcc","resolution":{"observed_at":"2026-08-07T14:25:22.234458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.239197Z","title":"SQ u AD : 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.239197Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:ae8aa8392bb83bf0be1ffc5e731a75552ee576bc113b150f4830f34007ba90e7","observation_id":"a31d4afe-dcec-4ff7-a1db-d94e91c7d41f","resolution":{"observed_at":"2026-08-07T14:25:22.239197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.245094Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.245094Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:aba6e11ec68cc2265d843009837bee9349491092047189af3f662b25784046a2","observation_id":"9245a6b5-e785-4207-b157-b69a084dad85","resolution":{"observed_at":"2026-08-07T14:25:22.245094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:25:22.249844Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.249844Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:61607daaf209f074a621a3bb5a6e2fdc4e33326e32050553feccb13db4606f0d","observation_id":"ebb0f529-46d0-4e5c-93d0-4a61e2cd81dc","resolution":{"observed_at":"2026-08-07T14:25:22.249844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10419","last_updated":"2024-08-19T21:12:41Z","snapshot_observed_at":"2026-08-05T03:54:59.078371Z","submitted_at":"2024-08-19T21:12:41Z","title":"Second-Order Forward-Mode Automatic Differentiation for Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10419","snapshot_observed_at":"2026-08-07T14:25:22.255032Z","title":"Second-order forward-mode automatic differentiation for optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.255032Z"},"links":{"cited_paper":"/paper/2408.10419","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:a3201ba2fffefe0718c8942a4ffbecd06484e932af8f80ae20e50e04e8d3d2db","observation_id":"02a068f5-cbb0-4130-847b-dd55170a42e4","resolution":{"observed_at":"2026-08-07T14:25:22.255032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.260229Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.260229Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:423cf51d23980bb9cbd805d8e883519b6de2eb2b8295347800f23cc6fcd7eeae","observation_id":"6677dad7-ed6b-4286-9978-3af6fbc2b58e","resolution":{"observed_at":"2026-08-07T14:25:22.260229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14186","last_updated":"2023-04-03T17:37:50Z","snapshot_observed_at":"2026-08-07T22:49:29.096522Z","submitted_at":"2023-03-24T17:56:22Z","title":"TRAK: Attributing Model Behavior at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14186","snapshot_observed_at":"2026-08-07T14:25:22.265773Z","title":"Trak: Attributing model behavior at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.265773Z"},"links":{"cited_paper":"/paper/2303.14186","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:b804edb92fe5f9bfacd21a65f7d69a831526c89e5e8ce21b82b0bcf8bacc8d38","observation_id":"8e7dcbd0-9d4b-4b92-a234-6347c225cabd","resolution":{"observed_at":"2026-08-07T14:25:22.265773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-07T14:25:22.270445Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.270445Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:089e4f6379806470b594712682a0beade588108c8cc6e4ee686e77a2cb3281c3","observation_id":"36afd5ad-b3d3-4fa0-8887-ea30f67f55c6","resolution":{"observed_at":"2026-08-07T14:25:22.270445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14200","last_updated":"2023-05-04T13:55:21Z","snapshot_observed_at":"2026-07-06T13:36:26.296409Z","submitted_at":"2022-07-28T16:13:28Z","title":"CrAM: A Compression-Aware Minimizer","version":4},"cited_work":{"arxiv_id":"2207.14200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.14200","snapshot_observed_at":"2026-08-07T14:25:22.745234Z","title":"CrAM: A Compression-Aware Minimizer","venue":"cs.LG","work_id":"be0b735e-dee4-4c0c-8039-6984160eca07","year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.275388Z"},"links":{"cited_paper":"/paper/2207.14200","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4a6f0db52003f14e785631f9f20b99dd0e10e1379530006bbb98ffb6fc262f21","observation_id":"6e3305e8-fbf8-45f9-bbb6-941bef4d9fb2","resolution":{"observed_at":"2026-08-07T14:25:22.759076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.280856Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.280856Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1ee26f6c46b4069f4441ed5c97c8e7526e94fbd520652008d91962c483c96307","observation_id":"47a69f1c-e9f3-4c64-bc1b-069c5604184e","resolution":{"observed_at":"2026-08-07T14:25:22.280856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.563964Z","title":"o pf, Yannic Kilcher, Dimitri Von R \\","venue":null,"work_id":"356a3263-8897-444e-94c5-8670368043df","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.286354Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:922a4b0641cd5fc69c9a9f44c84401fbd2ec4dd80d78781b35d184433ff5991e","observation_id":"47599f09-4443-44ff-b2e8-12eb9cd12737","resolution":{"observed_at":"2026-08-07T14:25:23.570719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.291632Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.291632Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:e1ef75066123a6fea3a47c83512e8f1211f1c6b030bcb0a6b28d1462ac8ee83e","observation_id":"e7186ae3-75ed-441f-8451-c12f5d1b4c9e","resolution":{"observed_at":"2026-08-07T14:25:22.291632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T14:25:22.297208Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.297208Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5aa23ee46f3d33c20e06552e17c5c27acb07330e43cb3c2aad369f599286e992","observation_id":"f75019a2-5318-439a-88c0-baa0a93723a8","resolution":{"observed_at":"2026-08-07T14:25:22.297208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.531741Z","title":"Code alpaca: An instruction-following llama model for code generation, 2023","venue":null,"work_id":"0fc1cabc-0001-40e5-bf40-5b0e372d856e","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.302484Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cd2b7b7fdd19959f5cbfbc9bea691b26efa0ecf635731ea67970ba984185e20f","observation_id":"c8474305-6044-4d0e-9fb3-7910ac924ebb","resolution":{"observed_at":"2026-08-07T14:25:23.536533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.512047Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"c76f2f5f-ec31-49e9-85c6-ab6c201f2adb","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.309116Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:fe0e821ce35961288ffe3e4ecfeb24be1e1c586e521958438f9a4befcedd10cf","observation_id":"d7bd0df5-54eb-484d-98e4-91e61d49214c","resolution":{"observed_at":"2026-08-07T14:25:23.518864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T14:25:22.315333Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.315333Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:21ad0ababa5376b358678366adcdf249aa36102483d73c10afc8e2e74eb2ba05","observation_id":"7068f832-bd6c-4fc5-86ef-328f9326f2f6","resolution":{"observed_at":"2026-08-07T14:25:22.315333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.488045Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces, 2023","venue":null,"work_id":"904f304e-5867-4737-9c4e-feee94bc207a","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.321452Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:7174c1d40aeaf5a119e6825e7cc287708936f03672e51f80b59e1461f539d4ad","observation_id":"04a7edd7-6903-46dc-a012-cb0049da96f7","resolution":{"observed_at":"2026-08-07T14:25:23.498394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.327276Z","title":"Sciriff: A resource to enhance language model instruction-following over scientific literature","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.327276Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d7e85052f2d33a586fcb943dae42c587295d178687e6926738643489d9c90029","observation_id":"01ff910e-d46c-4c31-9199-9d7d391b3146","resolution":{"observed_at":"2026-08-07T14:25:22.327276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T14:25:22.332639Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.332639Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:65cdd727939bcb93e315748a65a114459f82ed1590183cb1efb14a308ffefd1d","observation_id":"de3062b4-e1da-4ee2-b833-0b457111a35e","resolution":{"observed_at":"2026-08-07T14:25:22.332639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-07T14:25:22.337440Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.337440Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:8f7abc437156bff3fc1a8e3f965bb76037781135e0d1b2cf6a71f1f49b0a1886","observation_id":"e984cdef-35ff-4ca2-abb9-a64fe1702d18","resolution":{"observed_at":"2026-08-07T14:25:22.337440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07899","last_updated":"2021-12-15T05:33:27Z","snapshot_observed_at":"2026-07-06T12:18:53.315820Z","submitted_at":"2021-12-15T05:33:27Z","title":"Large Dual Encoders Are Generalizable Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07899","snapshot_observed_at":"2026-08-07T14:25:22.342650Z","title":"Large dual encoders are generalizable retrievers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.342650Z"},"links":{"cited_paper":"/paper/2112.07899","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1c135899f4d9bbaf1809cab4c436dea81f573b3268e6fd1ee5139f0aefda6f6a","observation_id":"261a37da-89c6-4cf4-83e0-86e9bdbd9157","resolution":{"observed_at":"2026-08-07T14:25:22.342650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T14:25:22.348275Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.348275Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:b9510464be0130c138affb6575ee23139eaca81990855df29d6d4a09631ace17","observation_id":"4d899f91-98c7-411e-a87d-069ad122b8f8","resolution":{"observed_at":"2026-08-07T14:25:22.348275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08832","last_updated":"2024-12-12T00:12:43Z","snapshot_observed_at":"2026-07-06T20:05:36.919481Z","submitted_at":"2024-12-12T00:12:43Z","title":"HadaCore: Tensor Core Accelerated Hadamard Transform Kernel","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08832","snapshot_observed_at":"2026-08-07T14:25:22.354721Z","title":"Hadacore: Tensor core accelerated hadamard transform kernel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.354721Z"},"links":{"cited_paper":"/paper/2412.08832","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:85bfae05b4ef4f2d1b6c4b45023d8f04a4976a25669a9acbd3564a1c30a95289","observation_id":"f5039b9f-99d5-4e32-955f-13a37e0dc572","resolution":{"observed_at":"2026-08-07T14:25:22.354721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.465871Z","title":"Fast hadamard transform in cuda, with a pytorch interface, 2023","venue":null,"work_id":"fab65e96-c94f-48a2-9371-f907e42212f6","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.360806Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:eafffb121f9471909bec2327530eff2d560332da7593fcd5c2a634461b16e0f7","observation_id":"206e9a1f-4905-400d-a309-729e1907d5fb","resolution":{"observed_at":"2026-08-07T14:25:23.471206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2505.19051."}