{"as_of":"2026-08-18T18:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b9ec83f9346affc12e1a021582e297a598cbfa7c53dbfc42b13370120c26339","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":77,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:34:53.570304Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":80,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:170ab14dfc3bc5b9569350e340905765d45718359a17a1ac052a1c47615bd2cd","observation_id":"5a6f788a-a0a6-4c36-8a87-1ebe2a3ecebe","resolution":{"observed_at":"2026-05-18T01:35:21.424024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T20:43:45.770157Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2306.01116"},"observation_digest":"sha256:9f07493b7688acfaa2803041a7ae2e9c78889872a2d1385d3cbd074ddf56352d","observation_id":"831c9e31-12e6-4466-a507-8f2a0986a6dd","resolution":{"observed_at":"2026-05-13T20:43:45.887160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:04f5da5ab13befa29409ea033a94bad0d09438bb77236a397d277f57bffdf1e4","observation_id":"f2b47ae6-3139-42ea-93f1-0e2283217e37","resolution":{"observed_at":"2026-05-16T09:46:10.063514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2403.03920","last_updated":"2024-03-06T18:29:18Z","snapshot_observed_at":"2026-08-06T13:47:15.957564Z","submitted_at":"2024-03-06T18:29:18Z","title":"Enhancing Instructional Quality: Leveraging Computer-Assisted Textual Analysis to Generate In-Depth Insights from Educational Artifacts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-24T03:07:32.103513Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2403.03920"},"observation_digest":"sha256:5416050f4cb9bebaf7543e2f86efcacd10e84e73ad29a005f604842f243dc03d","observation_id":"a2753f32-9be5-4eec-aef0-0b697da001d6","resolution":{"observed_at":"2026-05-24T03:08:48.125057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-12T04:32:25.049137Z","title":"and McIntosh, T.R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01312","last_updated":"2024-12-02T09:27:17Z","snapshot_observed_at":"2026-08-18T12:09:53.096413Z","submitted_at":"2024-12-02T09:27:17Z","title":"Can ChatGPT pass a physics degree? Making a case for reformation of assessment of undergraduate degrees","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:32:25.049137Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.01312"},"observation_digest":"sha256:b3e9606cc0365785bcd95b82d33bc50a4f7c7774288e660c18c0fb356ca991fc","observation_id":"d6f10483-5db1-49f1-9f04-dc38322d68b6","resolution":{"observed_at":"2026-08-12T04:32:25.049137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2412.02125","last_updated":"2026-05-01T15:42:42Z","snapshot_observed_at":"2026-08-17T03:55:38.085306Z","submitted_at":"2024-12-03T03:27:48Z","title":"Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T08:20:05.898025Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.02125"},"observation_digest":"sha256:b24eaff8da439dba806c61587c7fd904615957979a0f54c01bf20f886ad47ad7","observation_id":"3f8817db-60fb-4152-8a6c-ff7825881fc9","resolution":{"observed_at":"2026-05-23T08:22:44.236980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-11T22:06:54.256471Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03824","last_updated":"2025-06-01T22:36:28Z","snapshot_observed_at":"2026-08-14T08:21:56.307711Z","submitted_at":"2024-12-05T02:37:51Z","title":"Towards Data Governance of Frontier AI Models","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:54.256471Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.03824"},"observation_digest":"sha256:3caf9fd1cf56c66a4210539e3b6a601f4fe84b58122e3dd8804de527bc54be79","observation_id":"848b8176-fe63-4f73-a976-b0bed82d3e17","resolution":{"observed_at":"2026-08-11T22:06:54.256471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-11T21:13:00.810802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04942","last_updated":"2025-04-11T11:34:34Z","snapshot_observed_at":"2026-08-15T14:05:51.520842Z","submitted_at":"2024-12-06T11:00:05Z","title":"A Federated Approach to Few-Shot Hate Speech Detection for Marginalized Communities","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T21:13:00.810802Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.04942"},"observation_digest":"sha256:e16dec7a880c0f7860e27fa8f7874802b4571e0b94cc7fe7e0a827449a173309","observation_id":"262a8a64-92e3-4621-8870-a4f8f5e65940","resolution":{"observed_at":"2026-08-11T21:13:00.810802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-11T20:26:15.876889Z","title":"https://arxiv.org/abs/2211.04325","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05761","last_updated":"2024-12-07T23:25:13Z","snapshot_observed_at":"2026-08-18T12:09:57.619823Z","submitted_at":"2024-12-07T23:25:13Z","title":"Interactions Between Artificial Intelligence and Digital Public Infrastructure: Concepts, Benefits, and Challenges","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T20:26:15.876889Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.05761"},"observation_digest":"sha256:552271e7d234f660643c1fa36a4436092b77d5093630c6190e6b046199a3baf2","observation_id":"9e514f58-4e1f-46cd-a5d9-b580e990ceaa","resolution":{"observed_at":"2026-08-11T20:26:15.876889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-11T12:46:10.127865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13860","last_updated":"2024-12-18T13:53:59Z","snapshot_observed_at":"2026-08-17T20:41:46.700820Z","submitted_at":"2024-12-18T13:53:59Z","title":"Domain-adaptative Continual Learning for Low-resource Tasks: Evaluation on Nepali","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:46:10.127865Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.13860"},"observation_digest":"sha256:2582c4d8e9ea2661c42bdc10126f6ca7a6ff6921ccc536407d4c35fa9e5ba20b","observation_id":"5903fae7-375d-45c2-93a3-53bde9a10cc1","resolution":{"observed_at":"2026-08-11T12:46:10.127865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-11T11:40:52.570456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15151","last_updated":"2025-02-13T11:37:45Z","snapshot_observed_at":"2026-08-11T11:32:35.459573Z","submitted_at":"2024-12-19T18:28:41Z","title":"Language Models as Continuous Self-Evolving Data Engineers","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:52.570456Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2412.15151"},"observation_digest":"sha256:f4b0ed6f3ed1e2c8f8d4b40094e095e4486581dd86e905c667aa06efab3221cf","observation_id":"96b4d63a-fe9f-419c-b244-d6e4497f3e7a","resolution":{"observed_at":"2026-08-11T11:40:52.570456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-10T15:37:28.027916Z","title":"Villalobos, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13779","last_updated":"2025-06-03T17:52:57Z","snapshot_observed_at":"2026-08-14T16:07:47.249861Z","submitted_at":"2025-01-23T15:58:14Z","title":"Not Every AI Problem is a Data Problem: We Should Be Intentional About Data Scaling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T15:37:28.027916Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2501.13779"},"observation_digest":"sha256:d786c8a879e4ea16bed1da64c958d871661a682943420979f900210ab60475a1","observation_id":"1d68e051-9436-4202-af41-b71856f84b7b","resolution":{"observed_at":"2026-08-10T15:37:28.027916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-10T15:20:32.602995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14334","last_updated":"2025-01-27T14:50:32Z","snapshot_observed_at":"2026-08-13T11:17:42.268308Z","submitted_at":"2025-01-24T08:58:49Z","title":"Exploring the sustainable scaling of AI dilemma: A projective study of corporations' AI environmental impacts","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T15:20:32.602995Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2501.14334"},"observation_digest":"sha256:db4feb0335069de2b9594a2d65399577667d02544b749a8a200cbb2ea586a1c4","observation_id":"56457b2f-84b0-431a-9696-9d0fdfc5f58b","resolution":{"observed_at":"2026-08-10T15:20:32.602995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-09T23:52:06.037131Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18356","last_updated":"2025-01-30T14:03:36Z","snapshot_observed_at":"2026-08-17T19:25:00.073144Z","submitted_at":"2025-01-30T14:03:36Z","title":"State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T23:52:06.037131Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2501.18356"},"observation_digest":"sha256:0ab3536cea23ed41923773a0f9de28d2c38ffc90ad65ac8a25905ee08988e2e1","observation_id":"842e2fa5-f0fd-4b7f-8c2c-bfcb8d5a9be8","resolution":{"observed_at":"2026-08-09T23:52:06.037131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-09T19:21:22.337684Z","title":"Will we run out of data? Limits of LLM scaling based on human- generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.337684Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:08fd707a6a99be2db7d3655d6981a3ac21a3e10c1ef9b7fa3f0b363fd7bea737","observation_id":"4731627e-7fa4-4e11-a8e2-dc5e07e6b0df","resolution":{"observed_at":"2026-08-09T19:21:22.337684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-09T17:09:15.405937Z","title":"Will we run out of data? limits of llm scaling based on human-generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01697","last_updated":"2025-05-21T17:50:43Z","snapshot_observed_at":"2026-08-14T14:40:58.119601Z","submitted_at":"2025-02-03T00:12:40Z","title":"BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T17:09:15.405937Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.01697"},"observation_digest":"sha256:4acb412b3a06d2ba8e8ed9d643d19cfa5185353ecdc98710e608d52a034ad145","observation_id":"99900fa9-792c-4c23-ad14-0f4202cec919","resolution":{"observed_at":"2026-08-09T17:09:15.405937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-09T14:26:32.074862Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01806","last_updated":"2025-02-03T20:38:58Z","snapshot_observed_at":"2026-08-18T12:14:53.059277Z","submitted_at":"2025-02-03T20:38:58Z","title":"Toward Neurosymbolic Program Comprehension","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T14:26:32.074862Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.01806"},"observation_digest":"sha256:590136baed5eda783a8ed74187b3a510ba95d0cd1f09997d1c09e83cd62ba05a","observation_id":"73549ae8-b156-4366-b838-528b5ee46227","resolution":{"observed_at":"2026-08-09T14:26:32.074862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-08T23:08:35.521790Z","title":"Will we run out of data? an analysis of the limits of scaling datasets in machine learning.arXiv preprint arXiv:2211.04325, 1, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04235","last_updated":"2025-05-19T11:52:17Z","snapshot_observed_at":"2026-08-15T16:07:43.069937Z","submitted_at":"2025-02-06T17:19:55Z","title":"Reformulation for Pretraining Data Augmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T23:08:35.521790Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.04235"},"observation_digest":"sha256:e1088e9ca93e7c00c13d4cef473df5d833647cbf5e2aa131c67f2b8d916ad00b","observation_id":"68c1292b-d7b5-4ff2-ae81-2af432f37b84","resolution":{"observed_at":"2026-08-08T23:08:35.521790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2502.04419","last_updated":"2026-05-05T09:32:34Z","snapshot_observed_at":"2026-08-12T16:06:40.953262Z","submitted_at":"2025-02-06T15:20:58Z","title":"Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T03:53:00.509414Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.04419"},"observation_digest":"sha256:8298d2b9be7cfc28f6be77f40f0aa4e2417b0f95bc9b817d432cb45a3272b709","observation_id":"c7ca237a-e0d2-4117-a607-fc3f3d0c8afa","resolution":{"observed_at":"2026-05-23T03:55:21.898749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T20:51:22.558001Z","title":"Will we run out of data? limits of llm scaling based on human- generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09717","last_updated":"2025-02-13T19:06:10Z","snapshot_observed_at":"2026-08-18T12:15:44.639992Z","submitted_at":"2025-02-13T19:06:10Z","title":"Carbon- and Precedence-Aware Scheduling for Data Processing Clusters","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T20:51:22.558001Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.09717"},"observation_digest":"sha256:a56cd5ea44903c0e2c0022527a104e0a59a2917e634f85a27cbd5f1d1fd56f97","observation_id":"e5315d0c-680f-47d4-9503-49ccc0ac289d","resolution":{"observed_at":"2026-08-07T20:51:22.558001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-10T13:40:46.888906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15719","last_updated":"2025-01-27T16:25:03Z","snapshot_observed_at":"2026-08-15T12:40:41.964452Z","submitted_at":"2025-01-27T16:25:03Z","title":"Governing AI Beyond the Pretraining Frontier","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T13:40:46.888906Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.15719"},"observation_digest":"sha256:6033006981a2e971d2407670d1cbaa18ac331ab85abe2cb3bde4b1be04cdff18","observation_id":"01efc45d-5d01-406b-948e-7755469047e7","resolution":{"observed_at":"2026-08-10T13:40:46.888906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-08T13:31:19.296369Z","title":"Villalobos, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.19425","last_updated":"2025-02-11T03:11:42Z","snapshot_observed_at":"2026-08-18T12:14:35.673040Z","submitted_at":"2025-02-11T03:11:42Z","title":"Will the Technological Singularity Come Soon? Modeling the Dynamics of Artificial Intelligence Development via Multi-Logistic Growth Process","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:19.296369Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.19425"},"observation_digest":"sha256:b21e86e71eac966ed45c35fb625c067eb207de49132202bafe803ca0ae42de63","observation_id":"1ec157f3-0afd-4d78-a41f-0421b661ea15","resolution":{"observed_at":"2026-08-08T13:31:19.296369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-08-13T00:23:14.495568Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:d202b8b5696b09694bb73de7b417696ac6179cd605b8249d4095ae836d8200dd","observation_id":"a01342c8-52f5-49ce-9c6e-f7f9a1e75a02","resolution":{"observed_at":"2026-05-23T01:05:16.560310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T12:34:53.570304Z","title":"Will we run out of data? limits of llm scaling based on human-generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-18T07:05:41.415664Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.570304Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:6e526291f1a63434f7d716f770766991f411d9c92d3138e4403e00e6f59fa379","observation_id":"cbf0bcf5-7040-43f4-ae36-73e83a968d80","resolution":{"observed_at":"2026-08-16T12:34:53.570304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T12:19:28.138230Z","title":"Pablo Villalobos, Anson Ho, Jaime Sevilla, Tamay Besiroglu, Lennart Heim, and Marius Hobbhahn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.13123","last_updated":"2025-05-17T06:50:58Z","snapshot_observed_at":"2026-08-18T10:36:13.312296Z","submitted_at":"2025-04-17T17:40:06Z","title":"Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:28.138230Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2504.13123"},"observation_digest":"sha256:a7887e7d977cb70454640be277463a6dd65b842011b02edb0cb2f606e6e6619f","observation_id":"3080e3a3-abdd-42a7-bdea-6fe2c804baa1","resolution":{"observed_at":"2026-08-16T12:19:28.138230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T10:47:20.289891Z","title":"5 Published as a workshop paper at ‘Tackling Climate Change with Machine Learning’, ICLR 2025 F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17321","last_updated":"2025-04-24T07:23:27Z","snapshot_observed_at":"2026-08-18T10:30:16.870137Z","submitted_at":"2025-04-24T07:23:27Z","title":"Dargana: fine-tuning EarthPT for dynamic tree canopy mapping from space","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:20.289891Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2504.17321"},"observation_digest":"sha256:904b5f73f081e1e2cb0d8997e357cc0d358175a73b577083d70eec2c6dde2e9e","observation_id":"4d011f77-b867-47aa-9bc5-21ab0a5ae992","resolution":{"observed_at":"2026-08-16T10:47:20.289891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T04:39:14.117855Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00985","last_updated":"2025-05-25T14:53:34Z","snapshot_observed_at":"2026-08-17T19:26:39.886279Z","submitted_at":"2025-05-02T04:13:27Z","title":"Position: Enough of Scaling LLMs! Lets Focus on Downscaling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:14.117855Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.00985"},"observation_digest":"sha256:c62d2a3f968713432ca1d9476cbbdcb5ac17b5b2b5e2858ac92d7788c4e3dd36","observation_id":"14a84937-3fdd-4c8f-9cc0-ece3082d4d28","resolution":{"observed_at":"2026-08-16T04:39:14.117855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T00:59:55.898770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02275","last_updated":"2025-05-04T22:10:21Z","snapshot_observed_at":"2026-08-18T12:11:26.543144Z","submitted_at":"2025-05-04T22:10:21Z","title":"A Path Less Traveled: Reimagining Software Engineering Automation via a Neurosymbolic Paradigm","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:55.898770Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.02275"},"observation_digest":"sha256:e408f441ccde4072110a3859262db7df4062d09bd73caf394a57c5d36a775663","observation_id":"e6800c57-0937-404e-a74a-5918aac18046","resolution":{"observed_at":"2026-08-16T00:59:55.898770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T01:04:58.571255Z","title":"Will we run out of data? an analysis of the limits of scaling datasets in machine learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02462","last_updated":"2025-05-05T08:45:26Z","snapshot_observed_at":"2026-08-17T22:32:29.765584Z","submitted_at":"2025-05-05T08:45:26Z","title":"Incentivizing Inclusive Contributions in Model Sharing Markets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:58.571255Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.02462"},"observation_digest":"sha256:bc1ba2ffd463f221155b5b5c2ed4d3fd4f08a66f2f67f170b5982953b3f338ce","observation_id":"8388d6d6-7ee7-410a-8e49-6e64b2408816","resolution":{"observed_at":"2026-08-16T01:04:58.571255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-15T22:31:28.861620Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06964","last_updated":"2025-05-17T05:08:12Z","snapshot_observed_at":"2026-08-17T11:43:49.709641Z","submitted_at":"2025-05-11T12:32:57Z","title":"Bridging AI and Carbon Capture: A Dataset for LLMs in Ionic Liquids and CBE Research","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T22:31:28.861620Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.06964"},"observation_digest":"sha256:1a3634c0e8c83d16d61e64b111338f8e227f595b0d2aa65e34bec08ff6e4a678","observation_id":"82466082-51e3-412c-8899-ae44c2b3692c","resolution":{"observed_at":"2026-08-15T22:31:28.861620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-15T21:14:45.851502Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10475","last_updated":"2025-05-15T16:24:45Z","snapshot_observed_at":"2026-08-18T12:11:17.609605Z","submitted_at":"2025-05-15T16:24:45Z","title":"Parallel Scaling Law for Language Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T21:14:45.851502Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.10475"},"observation_digest":"sha256:f34db8144323deeff17f1cd6bb05754a1b438fddcc9756e262f80714e9ec9f04","observation_id":"f065f91d-2f0f-48d1-840d-ce4b007bf996","resolution":{"observed_at":"2026-08-15T21:14:45.851502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-15T20:31:39.292182Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12856","last_updated":"2025-05-19T08:42:24Z","snapshot_observed_at":"2026-08-18T12:13:26.306827Z","submitted_at":"2025-05-19T08:42:24Z","title":"Addressing memory bandwidth scalability in vector processors for streaming applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:39.292182Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.12856"},"observation_digest":"sha256:4d10275d5d9a742cdd4182edb291889cbfd07b9bea2a7a1da4f23337fbbd94d3","observation_id":"53ce9448-2e7b-4bb0-a398-68f2c5612986","resolution":{"observed_at":"2026-08-15T20:31:39.292182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-15T20:19:15.038184Z","title":"Will we run out of data? an analysis of the limits of scaling datasets in machine learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13404","last_updated":"2025-05-21T17:00:54Z","snapshot_observed_at":"2026-08-18T12:09:56.128415Z","submitted_at":"2025-05-19T17:40:58Z","title":"Granary: Speech Recognition and Translation Dataset in 25 European Languages","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:15.038184Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.13404"},"observation_digest":"sha256:0171aeb56aa6b3eadc2a5c56288450360840b8a2dfac26591b1e3e6c683508f9","observation_id":"bf8115c0-2833-498c-a89a-5b6722fdf237","resolution":{"observed_at":"2026-08-15T20:19:15.038184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T15:20:23.150570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15508","last_updated":"2025-05-21T13:27:38Z","snapshot_observed_at":"2026-08-10T19:26:09.750901Z","submitted_at":"2025-05-21T13:27:38Z","title":"Multilingual Test-Time Scaling via Initial Thought Transfer","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:23.150570Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.15508"},"observation_digest":"sha256:089f45f6c86eaaf1acdc0af66003ae6e04371935334d5191f2cfbe4398b115e6","observation_id":"e03034ff-c716-4d16-b365-62a4cea802f2","resolution":{"observed_at":"2026-08-07T15:20:23.150570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T15:15:46.537389Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15769","last_updated":"2025-05-21T17:18:51Z","snapshot_observed_at":"2026-08-18T17:05:30.609606Z","submitted_at":"2025-05-21T17:18:51Z","title":"Transfer of Structural Knowledge from Synthetic Languages","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:15:46.537389Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.15769"},"observation_digest":"sha256:0ff0309b6cc137e69afdf3b8f63900bd303609b3073ddba2a8ed620b974d4273","observation_id":"ad7abbee-0a8e-40b3-9e02-0f15c998f13e","resolution":{"observed_at":"2026-08-07T15:15:46.537389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T15:12:14.992638Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data.arXiv preprint arXiv:2211.04325, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16098","last_updated":"2025-05-22T00:58:50Z","snapshot_observed_at":"2026-08-13T06:10:34.917544Z","submitted_at":"2025-05-22T00:58:50Z","title":"Dimension-adapted Momentum Outscales SGD","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:14.992638Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.16098"},"observation_digest":"sha256:df57140725ee61a57c5f8241b505400003ee8d4627bd6e606a5f112df3c4e8bd","observation_id":"4612b370-df80-40a7-9d47-d1e2a4e3af3a","resolution":{"observed_at":"2026-08-07T15:12:14.992638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T14:35:48.589015Z","title":"Will we run out of data? limits of llm scaling based on human- generated data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18398","last_updated":"2025-05-23T22:05:20Z","snapshot_observed_at":"2026-08-18T12:10:39.088829Z","submitted_at":"2025-05-23T22:05:20Z","title":"Towards Anonymous Neural Network Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:35:48.589015Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.18398"},"observation_digest":"sha256:1355c9fd8aca30332a173ce281987c3746a10ec10f49f9b0d3d56df796b37637","observation_id":"14bb25b9-417e-4c09-80dd-5ba719829399","resolution":{"observed_at":"2026-08-07T14:35:48.589015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T14:38:08.046459Z","title":"Villalobos, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-14T07:35:18.071016Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.046459Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:0d8b3635d6d7891ec3a10e63a22461215417384f3f6d3902eab9a541c9042591","observation_id":"fbcb6a76-e838-4dc0-ad3a-c6b7899f51fc","resolution":{"observed_at":"2026-08-07T14:38:08.046459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T05:04:53.374794Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08756","last_updated":"2025-06-10T12:53:31Z","snapshot_observed_at":"2026-08-14T05:38:40.842277Z","submitted_at":"2025-06-10T12:53:31Z","title":"Bayesian Inverse Physics for Neuro-Symbolic Robot Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:53.374794Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.08756"},"observation_digest":"sha256:08497ef151aac1fd04e1fb70578ddde32e4ff47d76b7f6c8a87a2c81e58a9cce","observation_id":"689319c3-678d-4da4-a70a-b982d24d5ee7","resolution":{"observed_at":"2026-08-07T05:04:53.374794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T00:47:36.431460Z","title":"Is Synthetic Data the Future of AI?,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13818","last_updated":"2025-06-15T02:10:02Z","snapshot_observed_at":"2026-08-18T11:08:12.785838Z","submitted_at":"2025-06-15T02:10:02Z","title":"The Synthetic Mirror -- Synthetic Data at the Age of Agentic AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:47:36.431460Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.13818"},"observation_digest":"sha256:6ed8e0ef5bb2b7f8c45d1db2df1077c3a5e6a3f2875e9f9fdbe869d0beb877a8","observation_id":"509c0d6b-3565-443d-ae07-842750376b53","resolution":{"observed_at":"2026-08-07T00:47:36.431460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T13:59:49.328946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15690","last_updated":"2025-07-24T05:08:02Z","snapshot_observed_at":"2026-08-15T18:11:38.661263Z","submitted_at":"2025-05-26T22:10:52Z","title":"LLM Web Dynamics: Tracing Model Collapse in a Network of LLMs","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:59:49.328946Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.15690"},"observation_digest":"sha256:907a7cd7c4369739b092ce3bc6c307b5356a91692146443470bdca8cfbaf2e30","observation_id":"78185f72-cefe-4955-b62b-d7dafd7db555","resolution":{"observed_at":"2026-08-07T13:59:49.328946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-15T19:03:27.375820Z","title":"Will we run out of data? an analysis of the limits of scaling datasets in machine learning.arXiv preprint arXiv:2211.04325, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17847","last_updated":"2025-06-21T22:45:40Z","snapshot_observed_at":"2026-08-18T12:10:42.237023Z","submitted_at":"2025-06-21T22:45:40Z","title":"A Comparative Study of Open-Source Libraries for Synthetic Tabular Data Generation: SDV vs. SynthCity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:27.375820Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.17847"},"observation_digest":"sha256:eb33fb0f62ada9eaa2fbece3e197df8492211c73d4d4746fa7215969feeeada3","observation_id":"565350d4-04dd-4b8b-a364-fc0f17141ba1","resolution":{"observed_at":"2026-08-15T19:03:27.375820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T22:57:07.185572Z","title":"Villalobos et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20623","last_updated":"2025-07-09T08:24:09Z","snapshot_observed_at":"2026-08-18T12:09:59.279948Z","submitted_at":"2025-06-25T17:12:22Z","title":"Lost in Retraining: Roaming the Parameter Space of Exponential Families Under Closed-Loop Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:07.185572Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.20623"},"observation_digest":"sha256:8a278c0520f2f03a03859dc086be3ae2a1b29dcc6a33558ab6cd6db6e1da62e5","observation_id":"8d551cc3-3d97-40c4-9a23-aa876ffa6622","resolution":{"observed_at":"2026-08-06T22:57:07.185572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2506.21734","last_updated":"2025-08-04T08:45:08Z","snapshot_observed_at":"2026-08-13T09:09:47.358626Z","submitted_at":"2025-06-26T19:39:54Z","title":"Hierarchical Reasoning Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T04:58:03.283911Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.21734"},"observation_digest":"sha256:c9b5030054b58dddc6efcd4fe3f53e41aeaddad8d7ec3bf3450b4ea3e441c631","observation_id":"edcf4a8a-367e-4fc7-87cf-cc2df63f800d","resolution":{"observed_at":"2026-05-15T04:58:03.457295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T22:10:42.018922Z","title":"Will we run out of data? limits of llm scaling based on human-generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22696","last_updated":"2025-06-28T00:29:42Z","snapshot_observed_at":"2026-08-17T22:55:49.825609Z","submitted_at":"2025-06-28T00:29:42Z","title":"Residual Matrix Transformers: Scaling the Size of the Residual Stream","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:10:42.018922Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2506.22696"},"observation_digest":"sha256:d8dbafad699d8c83a4147021d7be909e40cfedff12a2301c0719d42c9870df04","observation_id":"ea500b1a-5515-4f4a-935e-322268ff2939","resolution":{"observed_at":"2026-08-06T22:10:42.018922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T20:42:37.584623Z","title":"Will we run out of data? an analysis of the limits of scaling datasets in machine learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-17T19:50:10.817332Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:37.584623Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ae4a7e4707a56aa4c16069987d0c3ce3968010c5ff9eeb13dee5d0fb9ca52401","observation_id":"9abf2387-9409-4fbc-90b8-c5f0f70d8c5f","resolution":{"observed_at":"2026-08-06T20:42:37.584623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T19:53:35.442569Z","title":"arXiv preprint arXiv:2211.04325 (Oct 2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04432","last_updated":"2025-07-06T15:35:45Z","snapshot_observed_at":"2026-08-18T03:49:52.108935Z","submitted_at":"2025-07-06T15:35:45Z","title":"Reconstructing Biological Pathways by Applying Selective Incremental Learning to (Very) Small Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:35.442569Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2507.04432"},"observation_digest":"sha256:87511804d1a08be3ef72d31c31067cc43e6f847c96b2955385038b45a3a039f4","observation_id":"d31d45bc-27ea-4193-bbe7-042c3d85530c","resolution":{"observed_at":"2026-08-06T19:53:35.442569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T21:43:40.536802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05266","last_updated":"2025-06-30T06:14:32Z","snapshot_observed_at":"2026-08-16T23:53:57.727777Z","submitted_at":"2025-06-30T06:14:32Z","title":"User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T21:43:40.536802Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2507.05266"},"observation_digest":"sha256:170ebbc5b05b379f4e7660f75cef17c4e7d1230fb6de3d9c5b783561c9ee2abb","observation_id":"d0faab4c-2961-44a0-84f7-399bba3419db","resolution":{"observed_at":"2026-08-06T21:43:40.536802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T16:17:43.060987Z","title":"Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13966","last_updated":"2025-09-01T20:28:13Z","snapshot_observed_at":"2026-08-17T21:20:53.105380Z","submitted_at":"2025-07-18T14:30:08Z","title":"Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:43.060987Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2507.13966"},"observation_digest":"sha256:e04f949e6f1e63b72e7d0a7d6cf44a6f6adab01ae9c0d764d65202bf22f5f978","observation_id":"5468e308-bcc6-4515-8258-05aa1c0a1120","resolution":{"observed_at":"2026-08-06T16:17:43.060987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T16:29:11.630290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14240","last_updated":"2025-09-04T23:06:49Z","snapshot_observed_at":"2026-08-17T22:04:15.154391Z","submitted_at":"2025-07-17T17:34:13Z","title":"HuggingGraph: Understanding the Supply Chain of LLM Ecosystem","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:29:11.630290Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2507.14240"},"observation_digest":"sha256:73b4e7064778484ecb96085eeb4528992fc6560ba7617e1f296bdb3ff61756ec","observation_id":"295e86fa-ded3-4644-bd65-a085b6d81857","resolution":{"observed_at":"2026-08-06T16:29:11.630290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T12:08:23.444125Z","title":"Will we run out of data? limits of llm scaling based on human-generated data.arXiv preprint arXiv:2211.04325 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22062","last_updated":"2025-08-01T06:40:13Z","snapshot_observed_at":"2026-08-16T00:47:38.398479Z","submitted_at":"2025-07-29T17:59:58Z","title":"Meta CLIP 2: A Worldwide Scaling Recipe","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:23.444125Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2507.22062"},"observation_digest":"sha256:9ad70ef57e793c70b794647ff97405cedc529f072f1aaf3884bb9d2498dd659b","observation_id":"f0a212a6-4dde-4bc2-b561-d028cfc6cc4e","resolution":{"observed_at":"2026-08-06T12:08:23.444125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-06T05:48:28.385076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01317","last_updated":"2025-08-06T06:44:57Z","snapshot_observed_at":"2026-08-13T20:04:42.445845Z","submitted_at":"2025-08-02T11:09:06Z","title":"LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:48:28.385076Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2508.01317"},"observation_digest":"sha256:96224b77c04caa1d3ffc9a0228bf17f3289d413e2997fed72bf3528aba8ee9ac","observation_id":"5415c29a-ec84-4c8b-a45f-c5dfb6d20f83","resolution":{"observed_at":"2026-08-06T05:48:28.385076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T21:05:45.242496Z","title":"Will we run out of data? limits of llm scaling based on human-generated data, 2024.https://arxiv.org/abs/2211.04325","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09494","last_updated":"2025-08-13T04:54:43Z","snapshot_observed_at":"2026-08-14T05:17:05.217723Z","submitted_at":"2025-08-13T04:54:43Z","title":"Learning Facts at Scale with Active Reading","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:05:45.242496Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2508.09494"},"observation_digest":"sha256:fd5a54295cd98fc5041242ffdd675c4441602b5dc9dc9687110092e1a4b6f741","observation_id":"7fbcc309-8d5e-43df-b604-0813db2ba0a9","resolution":{"observed_at":"2026-08-05T21:05:45.242496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T18:24:29.213666Z","title":"Will we run out of data? limits of llm scaling based on human-generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14751","last_updated":"2026-07-21T02:05:09Z","snapshot_observed_at":"2026-08-18T12:13:28.971797Z","submitted_at":"2025-08-20T14:50:28Z","title":"HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T18:24:29.213666Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2508.14751"},"observation_digest":"sha256:88447a0abd2ef3ef0c4e7220daf4321ac2ebcd52c8040fd63105f8e8437e3fca","observation_id":"997fcac4-34ca-4ce7-bbc4-77fa54a4521f","resolution":{"observed_at":"2026-08-05T18:24:29.213666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T06:00:20.668234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05382","last_updated":"2025-09-05T01:01:21Z","snapshot_observed_at":"2026-08-15T04:25:01.188229Z","submitted_at":"2025-09-05T01:01:21Z","title":"User Privacy and Large Language Models: An Analysis of Frontier Developers' Privacy Policies","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T06:00:20.668234Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2509.05382"},"observation_digest":"sha256:ddd4fdc50984685d73b52624c740c104f14167d4f2aacb0aeea51ce411d0c610","observation_id":"128ab968-9b7b-4d12-af2c-da3479e348b1","resolution":{"observed_at":"2026-08-05T06:00:20.668234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-04T20:42:45.708509Z","title":"Will we run out of data? limits of llm scaling based on human-generated data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08400","last_updated":"2025-09-10T08:44:57Z","snapshot_observed_at":"2026-08-18T00:48:27.008266Z","submitted_at":"2025-09-10T08:44:57Z","title":"Ubiquitous Intelligence Via Wireless Network-Driven LLMs Evolution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:42:45.708509Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2509.08400"},"observation_digest":"sha256:4aa21a4f0a8c045b74ed6f06c7635464a87de08058122b4bd3f50e3b01b6805d","observation_id":"5cae4786-ccbd-4b9e-869e-a917d914b6ae","resolution":{"observed_at":"2026-08-04T20:42:45.708509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-04T20:24:40.771539Z","title":"Villalobos, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08653","last_updated":"2025-09-11T11:18:17Z","snapshot_observed_at":"2026-08-16T10:46:59.090508Z","submitted_at":"2025-09-10T14:49:12Z","title":"Generative Data Refinement: Just Ask for Better Data","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T20:24:40.771539Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2509.08653"},"observation_digest":"sha256:b5c4b3655b11a689133dcd0e19d9cc2e92033c017dd1d28d1e238b5dfd01bb69","observation_id":"dd5843fe-ecff-4e71-8c42-ee35b2df103a","resolution":{"observed_at":"2026-08-04T20:24:40.771539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-04T17:03:13.329279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11176","last_updated":"2025-09-14T09:16:11Z","snapshot_observed_at":"2026-08-11T08:48:31.404393Z","submitted_at":"2025-09-14T09:16:11Z","title":"Differentially-private text generation degrades output language quality","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T17:03:13.329279Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2509.11176"},"observation_digest":"sha256:d125d81b44dc2469a0e87fd9161a62649f4dc1bf4dfb0a9b0627089a15a6779c","observation_id":"c4052d0f-c2d8-4173-bdaa-5c533ccb9e66","resolution":{"observed_at":"2026-08-04T17:03:13.329279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-03T11:25:09.571487Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.06649","last_updated":"2026-06-08T14:01:39Z","snapshot_observed_at":"2026-08-12T12:43:12.381241Z","submitted_at":"2026-01-10T18:24:40Z","title":"Revisiting Training Scale: An Empirical Study of Token Count, Power Consumption, and Parameter Efficiency","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:09.571487Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2601.06649"},"observation_digest":"sha256:2222950183e1fc2b629084ed71cfb68817da1b2244d91364ce2b7f4303404d73","observation_id":"97c729b3-34fd-4d99-9081-b058935585ac","resolution":{"observed_at":"2026-08-03T11:25:09.571487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2604.05135","last_updated":"2026-04-06T19:55:35Z","snapshot_observed_at":"2026-08-15T16:26:56.487183Z","submitted_at":"2026-04-06T19:55:35Z","title":"SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:18.737105Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2604.05135"},"observation_digest":"sha256:a41d8cef745b99db3bf6de25040d3225e25825a0bbe38e9e9c6122c73ccba717","observation_id":"ffbb22eb-bf1b-46a4-9813-0f61801d8f95","resolution":{"observed_at":"2026-05-11T00:05:50.338012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2604.19015","last_updated":"2026-04-21T03:06:24Z","snapshot_observed_at":"2026-08-12T19:59:46.610329Z","submitted_at":"2026-04-21T03:06:24Z","title":"FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T02:35:40.593397Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2604.19015"},"observation_digest":"sha256:edbab1dd480feeaa553f1eb6a64ad2c1b60d3b8772efdfb99f509e2ac8afc440","observation_id":"1c452130-863e-4fb8-a6f4-a9b79ccea0bd","resolution":{"observed_at":"2026-05-11T12:56:06.138293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2604.23026","last_updated":"2026-04-24T21:30:11Z","snapshot_observed_at":"2026-08-16T03:58:51.022234Z","submitted_at":"2026-04-24T21:30:11Z","title":"AI Hastens Limits to Exponential Growth","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T09:16:54.056531Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2604.23026"},"observation_digest":"sha256:043915da6b49a855c042a7c41ccb4ac32eb755e4b8f32b3937780d55a35e681d","observation_id":"9d682923-555e-4c88-88bb-c7f7f720d810","resolution":{"observed_at":"2026-05-11T20:21:13.249821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.01047","last_updated":"2026-05-01T19:20:31Z","snapshot_observed_at":"2026-08-14T08:45:07.541499Z","submitted_at":"2026-05-01T19:20:31Z","title":"LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T18:44:05.775332Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.01047"},"observation_digest":"sha256:abd1525f238e02b115ff10f0b9cbab1e3193240db5816cdde9f009f71c00c854","observation_id":"cc489784-f5ab-4d48-9384-289a812752d2","resolution":{"observed_at":"2026-05-11T16:06:22.448434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.04428","last_updated":"2026-05-06T02:43:13Z","snapshot_observed_at":"2026-08-14T05:10:56.258141Z","submitted_at":"2026-05-06T02:43:13Z","title":"Submodular Ground-Set Pruning: Monotone Tightness and a Non-Monotone Separation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T17:26:30.268643Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.04428"},"observation_digest":"sha256:06da49d16c9a65a0094f1f34742454ad678d5029808fdb2298dff2a37af91597","observation_id":"513ba88d-9229-4d55-afb3-7dd8ed8c1bce","resolution":{"observed_at":"2026-05-11T17:36:04.791771Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-08-11T18:23:56.230059Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-08T15:35:08.202464Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:edc6b0361bc2217f31bc506a13e1c01217fcb66c957e86a0a527c03c1b5ac9e1","observation_id":"128389b6-8509-4ce8-a49d-dd509c92dca8","resolution":{"observed_at":"2026-05-11T18:36:06.631428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-08-11T18:23:56.230059Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:55.375541Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:931c45c93b49753df86a373d2deb86d0af8ab2c6232254b592bca3498fbf2524","observation_id":"e83ca845-5e91-4fa9-9270-2aebd77450fd","resolution":{"observed_at":"2026-06-30T23:35:07.984390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.07474","last_updated":"2026-05-08T09:20:56Z","snapshot_observed_at":"2026-08-15T05:24:08.654640Z","submitted_at":"2026-05-08T09:20:56Z","title":"ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:28.068087Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.07474"},"observation_digest":"sha256:c0dae873f031b99d647e29ba5a03ad4672407c419d212c4d9d8bf49a54d6f7f9","observation_id":"062cdf99-ddad-49ad-ba21-711e408a37c0","resolution":{"observed_at":"2026-05-11T04:20:55.477138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.07724","last_updated":"2026-06-03T12:55:17Z","snapshot_observed_at":"2026-08-13T10:43:02.284944Z","submitted_at":"2026-05-08T13:27:23Z","title":"Curated Synthetic Data Doesn't Have to Collapse: A Theoretical Study of Generative Retraining with Pluralistic Preferences","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-11T02:30:14.693348Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.07724"},"observation_digest":"sha256:f20b10091f94a1aadd161e1c95f692dde777466a9a246cc768752633fbd199a6","observation_id":"9c139432-a16c-4192-a058-7135c6ff2a80","resolution":{"observed_at":"2026-05-11T02:30:54.418300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.11733","last_updated":"2026-05-12T08:15:04Z","snapshot_observed_at":"2026-08-15T05:43:54.051129Z","submitted_at":"2026-05-12T08:15:04Z","title":"Position: LLM Inference Should Be Evaluated as Energy-to-Token Production","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-13T05:17:24.147248Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.11733"},"observation_digest":"sha256:a506a59315958c71d6cf8fa38f3df9b8959c6cf4d99c7fdaa9f4d79b5b19f83d","observation_id":"d814c45a-47fa-4772-96d6-058b6c4d1100","resolution":{"observed_at":"2026-05-13T05:27:19.456297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2605.18535","last_updated":"2026-05-18T15:18:29Z","snapshot_observed_at":"2026-08-15T02:03:56.286840Z","submitted_at":"2026-05-18T15:18:29Z","title":"Beyond Scaling: Agents Are Heading to the Edge","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T11:51:14.999341Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2605.18535"},"observation_digest":"sha256:64fb00e32da07310d3b630a11da6e946f83a6a29323376c3f6154bbdd1319092","observation_id":"e5f6a51d-979a-4857-af91-545854798ccf","resolution":{"observed_at":"2026-05-20T11:53:14.918737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2606.01155","last_updated":"2026-05-31T10:51:18Z","snapshot_observed_at":"2026-08-17T18:58:45.046048Z","submitted_at":"2026-05-31T10:51:18Z","title":"When Data Is Scarce: Scaling Sparse Language Models with Repeated Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:48.536850Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2606.01155"},"observation_digest":"sha256:2992711ab1c2df634dabd1b81aa532182eef2716d703669711b81ea45aa6634b","observation_id":"cf2ae034-3a0b-4681-90bc-b36f63c2fda9","resolution":{"observed_at":"2026-06-28T17:22:25.188002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2606.06888","last_updated":"2026-06-09T06:01:51Z","snapshot_observed_at":"2026-08-01T16:12:34.477524Z","submitted_at":"2026-06-05T04:10:09Z","title":"Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T22:24:01.067388Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2606.06888"},"observation_digest":"sha256:c4dfc1b8b01699b596fbec1f8f1ddbaa1a7a60c9abb13c2bfcad7518fe2428ac","observation_id":"c19a4932-413e-4e86-8f2e-1119549dad61","resolution":{"observed_at":"2026-07-02T16:47:09.820598Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2606.10127","last_updated":"2026-06-08T20:00:42Z","snapshot_observed_at":"2026-08-13T22:56:16.896463Z","submitted_at":"2026-06-08T20:00:42Z","title":"Data-Driven Automation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T13:58:40.370152Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2606.10127"},"observation_digest":"sha256:3c7e5afcccb360260709d554863612ed68f38d01907d4b91320aa6bfc1e0d33d","observation_id":"30d223e5-6b82-48a5-9b0d-44959168c99b","resolution":{"observed_at":"2026-07-03T04:27:36.200386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2606.12422","last_updated":"2026-05-08T16:32:43Z","snapshot_observed_at":"2026-08-14T10:53:33.491328Z","submitted_at":"2026-05-08T16:32:43Z","title":"Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-30T22:54:03.054871Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2606.12422"},"observation_digest":"sha256:961c30f40713ed2cf4b74dd1da9dfcb84123c0b5e944cd433aa01c801025ebb8","observation_id":"9c6b9f74-2cf2-475d-a001-39fbe79f505c","resolution":{"observed_at":"2026-06-30T22:55:06.335237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2606.16246","last_updated":"2026-06-19T17:02:20Z","snapshot_observed_at":"2026-08-14T21:34:57.187919Z","submitted_at":"2026-06-15T05:48:57Z","title":"Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T03:55:42.948380Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2606.16246"},"observation_digest":"sha256:35ea662cfd1d63c733779280a61936df0f0389af2c8d10fa6506f9482a3661c5","observation_id":"217dc43e-c9da-44b1-92a5-a52fff2b9e56","resolution":{"observed_at":"2026-07-03T17:38:44.254033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":"2211.04325","doi":"10.48550/arxiv.2211.04325","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":"arXiv (Cornell University)","work_id":"e9ffc77d-3e81-4a7f-9861-704f9accb1db","year":2025},"citing_paper":{"arxiv_id":"2606.30774","last_updated":"2026-06-29T18:06:36Z","snapshot_observed_at":"2026-08-17T05:40:22.499598Z","submitted_at":"2026-06-29T18:06:36Z","title":"What Drives Interactive Improvement from Feedback?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T02:36:20.649687Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2606.30774"},"observation_digest":"sha256:09a5362737d23a0b2fbc347e5131c3342e1b8d9556e009753db18489054ccab9","observation_id":"68a1ac45-c9db-4e92-bc33-7527ec0af216","resolution":{"observed_at":"2026-07-01T12:05:43.468362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-02T09:01:49.796306Z","title":"arXiv preprint arXiv:2211.04325 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19391","last_updated":"2026-07-02T19:01:59Z","snapshot_observed_at":"2026-08-14T00:07:02.064739Z","submitted_at":"2026-07-02T19:01:59Z","title":"LAARA: Layer-Aware Adaptive Rank Allocation for Parameter-Efficient Fine-Tuning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T09:01:49.796306Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2607.19391"},"observation_digest":"sha256:febf96e00c6cce5f3154923bfac8c7832b75c96ebca82a901ca84160c5f1981c","observation_id":"8d06a739-dfc6-4a3a-8f19-c728b4707174","resolution":{"observed_at":"2026-08-02T09:01:49.796306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2211.04325/citation-record","integrity":"/paper/2211.04325/integrity","json":"/paper/2211.04325/citation-record.json","paper":"/paper/2211.04325"},"outbound":[],"paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 77 inbound Pith citation observations for arXiv:2211.04325."}