{"as_of":"2026-08-11T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:862139a0f7cba078b0f40355395dec2c38a119ec06b3e8e56dfc7f3c56c8d166","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:53:08.641036Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:16:23.842092Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2408.03314"},"observation_digest":"sha256:403956ccd5f8106a3fdf1f7c8506698eb934a61ad6e8ef6f8e005bf0d38a9c1c","observation_id":"4b726d53-b9a7-4127-8c27-be1661a25895","resolution":{"observed_at":"2026-05-10T14:16:23.871304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-10T04:07:56.506438Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:5bda730afe97aa0ee055a39a70ffac16d3b71fc6f3bad4062fa4bd3d1c89f1d4","observation_id":"9908adf4-4096-4377-88ab-dfefffa41465","resolution":{"observed_at":"2026-05-13T17:30:02.919309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-06T16:53:08.641036Z","title":"Does your data spark joy? performance gains from domain upsampling at the end of training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-09T12:12:41.025897Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:08.641036Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:7afb5f01d2f439c71cffa50c323cedb5105b03231a7b78051221f69897804e03","observation_id":"85b25a7e-3f1d-495e-8096-3eae7485d039","resolution":{"observed_at":"2026-08-06T16:53:08.641036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-06T14:20:37.130182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19586","last_updated":"2025-07-25T18:00:21Z","snapshot_observed_at":"2026-08-07T21:42:42.944892Z","submitted_at":"2025-07-25T18:00:21Z","title":"Mitigating Geospatial Knowledge Hallucination in Large Language Models: Benchmarking and Dynamic Factuality Aligning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T14:20:37.130182Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2507.19586"},"observation_digest":"sha256:039aab861cb35c1fcbbbb28c62d952e3ea8185d2a91631747e46f349847da072","observation_id":"74aa8a65-a88f-4f57-9561-59f90caca0d5","resolution":{"observed_at":"2026-08-06T14:20:37.130182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-06T11:59:52.159243Z","title":"Does your data spark joy? performance gains from domain upsampling at the end of training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.159243Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:53eb46bfa38a0f8e05ac17f6a7e28714644109fa50532df2288bb0539ccb8fed","observation_id":"7f6c5223-f9ce-42a6-b4ba-59cf61fbcb53","resolution":{"observed_at":"2026-08-06T11:59:52.159243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2603.08022","last_updated":"2026-05-06T03:36:45Z","snapshot_observed_at":"2026-08-07T06:42:45.803675Z","submitted_at":"2026-03-09T06:58:00Z","title":"Capacity-Aware Mixture Law Enables Efficient LLM Data Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:23:30.849350Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2603.08022"},"observation_digest":"sha256:f5296796ba1f5c40470cab95891b0f7971535190fa087daae3f62ec1d5d097f0","observation_id":"10471077-be80-4b32-8815-0f9a3c91879a","resolution":{"observed_at":"2026-05-15T14:25:55.364976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2605.00072","last_updated":"2026-04-30T11:50:32Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T11:50:32Z","title":"XekRung Technical Report","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-05-09T20:55:10.400291Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2605.00072"},"observation_digest":"sha256:545aaf70192e8cbd294a13cdd8987eb4f38c93710196fdef17bd5c378d622af6","observation_id":"204710eb-0e69-413c-a64c-10445399cc8d","resolution":{"observed_at":"2026-05-09T20:58:06.753264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-09T11:43:52.076241Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:413fa648f2017835ea3c85515a6aa702063865f9d529f347c248e7d1130f1943","observation_id":"99f9b5a6-5603-49a0-a6b5-dad88d268d48","resolution":{"observed_at":"2026-05-11T17:26:05.244182Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:cfa553c822d78f7170ba826a6be3c162bf73af24790b91f85c03554cd9ad3027","observation_id":"09f8cd8d-2ed9-45bc-add9-9ad360d989f0","resolution":{"observed_at":"2026-07-04T18:40:03.309291Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":"2406.03476","doi":"10.48550/arxiv.2406.03476","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Owen, S., and Fran- kle, J","venue":"arXiv (Cornell University)","work_id":"efc95c99-f81f-450a-8792-bbcb7bfdd5c7","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:f8f311d70b11b531463ec115b79a0d88a828c30c88c80ddddfb2dec6b880bc4d","observation_id":"2c859aab-7803-4f7e-9145-6dbf68aa80d6","resolution":{"observed_at":"2026-07-01T18:15:59.001887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-01T09:51:50.318054Z","title":"arXiv preprint arXiv:2406.03476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T09:51:50.318054Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:81822717a65256c017a587dfab534642bd0d61b2c6f70094258232ffe278346b","observation_id":"87328ef2-e8f0-430c-a537-27814a2311e2","resolution":{"observed_at":"2026-08-01T09:51:50.318054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.03476/citation-record","integrity":"/paper/2406.03476/integrity","json":"/paper/2406.03476/citation-record.json","paper":"/paper/2406.03476"},"outbound":[],"paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2406.03476."}