{"as_of":"2026-08-07T23:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9df1f37df272cb939c3d7a07420d5362562aea4dbb177cce460659685f2d640e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:03.600455Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:115edaa327ae688834a8a407af081c1519b3684384e700bc8104d0a8bb1f3209","observation_id":"3d59eb21-f235-4807-978f-cb47c3275d11","resolution":{"observed_at":"2026-05-10T22:46:40.315894Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-15T11:44:38.066501Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2403.17297"},"observation_digest":"sha256:e095a9e3a3d84b5055ce3db2900a3f9269ee33e3cee5c30b90e0e6b58312b305","observation_id":"792957dc-e756-4ca0-bad0-21339c6cd949","resolution":{"observed_at":"2026-05-15T11:44:38.337372Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:6c94e2d432c00fc49df2100105f1ad9333a71837cc2f693e3592f117ab3e6a27","observation_id":"149a544f-2fdb-4df2-bf3a-ca4639ca9b4b","resolution":{"observed_at":"2026-05-17T22:58:17.197578Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:7275b00aacb6a3d417d56403ef23573fc3f3dafd14ee2720b4bdbad5187c371c","observation_id":"2e7b6d1c-21d2-49e5-8281-2fa89251ff4d","resolution":{"observed_at":"2026-05-22T22:22:12.189477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T15:43:03.600455Z","title":"H.; Caverlee, J.; McAuley, J.; and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T15:38:52.146845Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.600455Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:de13ba4c939e17ad4c2272d73b5b8944b97c7c82ec285bfb8e55bb7af4196848","observation_id":"008d596f-f874-4fec-ae02-f2b8d97f73f7","resolution":{"observed_at":"2026-08-07T15:43:03.600455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T15:33:54.356737Z","title":"H., Caverlee, J., and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14826","last_updated":"2025-05-20T18:41:34Z","snapshot_observed_at":"2026-08-07T15:26:43.583135Z","submitted_at":"2025-05-20T18:41:34Z","title":"FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:33:54.356737Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.14826"},"observation_digest":"sha256:2270abb2f0ef37568b64ecf3d5991086e111f0e34b6bce5a4f1d724538649556","observation_id":"75691a37-0af0-4eb6-8cbb-6578d75e4297","resolution":{"observed_at":"2026-08-07T15:33:54.356737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T14:09:49.740308Z","title":"H., Caverlee, J., McAuley, J., and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.740308Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ff4d9eba259b7fd029689767fdc63123dd83fb362157b98aee0a1c05b44c3560","observation_id":"7be11a93-fc4f-456a-b1ce-c09431db1d5d","resolution":{"observed_at":"2026-08-07T14:09:49.740308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T14:02:21.726501Z","title":"How to tr ain data-efﬁcient llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20120","last_updated":"2025-05-26T15:22:04Z","snapshot_observed_at":"2026-08-07T13:56:30.054255Z","submitted_at":"2025-05-26T15:22:04Z","title":"Agents Require Metacognitive and Strategic Reasoning to Succeed in the Coming Labor Markets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:21.726501Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.20120"},"observation_digest":"sha256:3a7fb660fdcda570280b28791698c8481f7516e20b9d59cb169328e040772df7","observation_id":"8e5f661e-1df7-4c21-b0f1-6e0f8d337875","resolution":{"observed_at":"2026-08-07T14:02:21.726501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T13:19:31.769180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22232","last_updated":"2025-05-31T15:28:40Z","snapshot_observed_at":"2026-08-07T13:09:59.153649Z","submitted_at":"2025-05-28T11:06:54Z","title":"Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:19:31.769180Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.22232"},"observation_digest":"sha256:b196e0c4b72bc13a9cbd049ad0e23a057edf78abf0b9d9b4c1af81b7ef857e56","observation_id":"45a2bb00-27e7-413c-aad1-04bfb0365e04","resolution":{"observed_at":"2026-08-07T13:19:31.769180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T10:28:22.198008Z","title":"H., Caverlee, J., McAuley, J., and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05109","last_updated":"2025-06-05T14:53:35Z","snapshot_observed_at":"2026-08-07T10:21:53.068253Z","submitted_at":"2025-06-05T14:53:35Z","title":"Truly Self-Improving Agents Require Intrinsic Metacognitive Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:28:22.198008Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2506.05109"},"observation_digest":"sha256:93686d007ac116258a0f1197fbc2aba5c0bc2a6a17b7bdffa2a1b96e21a75341","observation_id":"baf9518d-8283-4d8e-9693-627a73a6bf4c","resolution":{"observed_at":"2026-08-07T10:28:22.198008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T04:58:09.750924Z","title":"McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-07T12:51:38.948660Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.750924Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:1322ab7c8f10b57218e5ac6736132076cfa70185f110afa1d0d878757977ab93","observation_id":"9d290ed7-dc77-45a3-b4e6-29d20b1418fa","resolution":{"observed_at":"2026-08-07T04:58:09.750924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T00:42:57.821522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-07T00:33:59.206204Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.821522Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:33cdc2d1330644a2e7d925bd68211c934b8752a79304176265210aa6623f5dff","observation_id":"2a1f4957-80ec-4cd3-a2fd-c1a72c8777ca","resolution":{"observed_at":"2026-08-07T00:42:57.821522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-06T20:15:24.716339Z","title":"Chi, James Caverlee, Julian McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03648","last_updated":"2025-07-04T15:25:04Z","snapshot_observed_at":"2026-08-06T20:02:40.466269Z","submitted_at":"2025-07-04T15:25:04Z","title":"Disentangling the Roles of Representation and Selection in Data Pruning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:15:24.716339Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2507.03648"},"observation_digest":"sha256:6533db6d13d7b214bc89a7c4d45f19aaa4b202ca06656f75c4f472cefc07a080","observation_id":"98bac85f-4f08-4101-acf8-8a2b1e0ef229","resolution":{"observed_at":"2026-08-06T20:15:24.716339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-06T19:55:46.325370Z","title":"arXiv preprint arXiv:2402.09668 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04269","last_updated":"2025-07-06T07:02:04Z","snapshot_observed_at":"2026-08-06T19:49:38.018141Z","submitted_at":"2025-07-06T07:02:04Z","title":"Efficient Training of Deep Networks using Guided Spectral Data Selection: A Step Toward Learning What You Need","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:46.325370Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2507.04269"},"observation_digest":"sha256:61f139db52beecfa183ae286e0c3e22452d93ece107a48ed80f5225f32cf0458","observation_id":"f1040ee3-a77b-4e43-8c1c-ea8522bbea7f","resolution":{"observed_at":"2026-08-06T19:55:46.325370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-06T17:56:44.081602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.081602Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:2aa3f4a5bd628c0c3273dbf3c18bbd7363ef608613311368c2fc8ea1b629f0f4","observation_id":"6d867eea-4249-4856-8592-b3db67339c98","resolution":{"observed_at":"2026-08-06T17:56:44.081602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-06T17:21:32.871288Z","title":"Chi, James Caverlee, Julian McAuley and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11086","last_updated":"2025-07-15T08:28:24Z","snapshot_observed_at":"2026-08-06T17:14:22.722820Z","submitted_at":"2025-07-15T08:28:24Z","title":"Beyond Traditional Algorithms: Leveraging LLMs for Accurate Cross-Border Entity Identification","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:21:32.871288Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2507.11086"},"observation_digest":"sha256:8da471cec29c91c63af8a2a184cf8ef026090178c192b815b3023db8f53ef9d0","observation_id":"d6c6eb5c-08c4-4a4b-a6c8-30527e315b02","resolution":{"observed_at":"2026-08-06T17:21:32.871288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-06T16:53:13.006591Z","title":"How to train data-efficient llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-07T10:43:47.278118Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:13.006591Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:81cead57c816cb873cf6d5030943b65cb19d5a1bf7c6c8f24d3cb6d75f355cdc","observation_id":"8490cd5d-1c4f-4bab-95f1-f8eca72731b9","resolution":{"observed_at":"2026-08-06T16:53:13.006591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-04T23:33:42.206386Z","title":"McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.206386Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:358ac6a35d54a90af44761fab20353f561bf19971f3b971378663758dc1a25e6","observation_id":"3a86b5a3-61a3-4750-a132-2cb73815b823","resolution":{"observed_at":"2026-08-04T23:33:42.206386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2604.07769","last_updated":"2026-04-09T03:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T03:48:11Z","title":"An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T18:13:24.750244Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2604.07769"},"observation_digest":"sha256:c6df1aabb711fd2ed246699ce71ca7ba7b0d6105510eb46c5218433b271c9a9f","observation_id":"7860f5b1-4c1e-4780-86e1-89b7fa135eb3","resolution":{"observed_at":"2026-05-11T05:16:04.764330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2604.08519","last_updated":"2026-04-09T17:55:50Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:55:50Z","title":"Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-10T17:42:31.465077Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2604.08519"},"observation_digest":"sha256:50306b533da58447b453dcc08b91b1cbecf4eca2e89d7d80e72219bdf609b38e","observation_id":"6b912b53-402d-4d00-bb74-0e15c36c04ac","resolution":{"observed_at":"2026-05-11T06:15:59.080239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2604.12397","last_updated":"2026-04-14T07:33:14Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:33:14Z","title":"KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:22:59.883307Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2604.12397"},"observation_digest":"sha256:042d0f09686c2c02e5614ffacde4e9fff3801ed6537e23ca277ef093bf0c3d67","observation_id":"2b4a269f-1cbb-4eaf-b0d9-3a16f4405fe2","resolution":{"observed_at":"2026-05-11T10:41:04.697353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2604.16979","last_updated":"2026-04-18T12:41:06Z","snapshot_observed_at":"2026-08-05T19:01:26.929848Z","submitted_at":"2026-04-18T12:41:06Z","title":"DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:19:11.231416Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2604.16979"},"observation_digest":"sha256:4dbb1bff86aef3722f204155de1eda90f23543ae5d8f45d17efa64217765eb75","observation_id":"6601df6f-9c38-41f9-ab46-d3096b43ba4e","resolution":{"observed_at":"2026-05-10T06:21:26.951063Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:7f0c59068becd31ad627cda401d1653d9247faf96ec263a941afc0fddd862bb1","observation_id":"98535e94-9a8d-4b8a-8662-34780db3a8c3","resolution":{"observed_at":"2026-05-11T20:11:08.529589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:f3c538f003cf935c38585238d0958e7601c346f00a00ed7ea561d352768d3706","observation_id":"af26c0cc-ad3e-43fe-9683-2353c9ae1b0d","resolution":{"observed_at":"2026-05-11T05:00:54.594603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2605.06900","last_updated":"2026-05-07T20:00:40Z","snapshot_observed_at":"2026-07-06T23:19:20.674889Z","submitted_at":"2026-05-07T20:00:40Z","title":"Accelerated Relax-and-Round for Concave Coverage Problems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T00:52:41.972226Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2605.06900"},"observation_digest":"sha256:1b96922df979b96b0c222f7816c7326df27eb47d65ccd2d28990bab9414e6eae","observation_id":"9fe4cc44-6781-46ce-ab2f-60a76e197dfd","resolution":{"observed_at":"2026-05-11T05:05:57.094895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2605.06901","last_updated":"2026-05-07T20:02:53Z","snapshot_observed_at":"2026-07-06T23:19:20.674889Z","submitted_at":"2026-05-07T20:02:53Z","title":"Reflections and New Directions for Human-Centered Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:46.378350Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2605.06901"},"observation_digest":"sha256:4adaad8b4da06d0bfb6c94c26a10cf7a430adb59daff11fa2b6694f53d74383f","observation_id":"ad0f918b-ca1e-4b43-a0a9-df8466e9b472","resolution":{"observed_at":"2026-05-11T04:25:56.843634Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2605.30337","last_updated":"2026-05-28T17:59:01Z","snapshot_observed_at":"2026-08-06T03:38:35.973424Z","submitted_at":"2026-05-28T17:59:01Z","title":"Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T08:58:52.511363Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2605.30337"},"observation_digest":"sha256:bc94c1d5700250e78c43b671c7b4ddcda455a98f41d1a8ddc500a275e5c29f89","observation_id":"10576518-8575-43d8-9ea9-7263c128c47b","resolution":{"observed_at":"2026-06-29T09:03:15.950487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.09668","doi":"10.48550/arxiv.2402.09668","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sachdeva, B","venue":"arXiv (Cornell University)","work_id":"b0f019d0-8b33-4842-a519-7e8b767152e0","year":2024},"citing_paper":{"arxiv_id":"2606.07597","last_updated":"2026-05-29T06:08:57Z","snapshot_observed_at":"2026-07-29T16:14:13.340722Z","submitted_at":"2026-05-29T06:08:57Z","title":"Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T23:19:22.355753Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2606.07597"},"observation_digest":"sha256:e97c03c8fef2a4b7e7940a9e946f8ece354c5d80996ebbf46b525a5e57c7fa9e","observation_id":"741108f7-c40c-483a-9b45-dd06febbe00e","resolution":{"observed_at":"2026-06-28T23:22:46.237668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.09668/citation-record","integrity":"/paper/2402.09668/integrity","json":"/paper/2402.09668/citation-record.json","paper":"/paper/2402.09668"},"outbound":[],"paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2402.09668."}