{"as_of":"2026-08-07T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42de6a7fea197346ac65c2000e514f297e2345ef66b9ee0de202ce6587005e8b","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:21:57.501475Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T07:01:44.900291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:33:58.451084Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"cited_work":{"arxiv_id":"2507.03253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03253","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refinex: Learning to refine pre-training data at scale from expert-guided programs","venue":null,"work_id":"16d7ac0b-ed75-47c2-921c-c06ed52e6307","year":2025},"citing_paper":{"arxiv_id":"2605.20682","last_updated":"2026-05-20T03:52:21Z","snapshot_observed_at":"2026-08-02T13:01:00.493889Z","submitted_at":"2026-05-20T03:52:21Z","title":"IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T05:33:30.670201Z"},"links":{"cited_paper":"/paper/2507.03253","citing_paper":"/paper/2605.20682"},"observation_digest":"sha256:d289d9e91bd37f16d233403de7578cc9dc9d9b9eca85ff64c088a0034b15c7d5","observation_id":"a503399e-fa32-4421-87f0-e1c0935992fe","resolution":{"observed_at":"2026-05-21T05:33:58.452689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03253","snapshot_observed_at":"2026-07-31T07:01:44.900291Z","title":"arXiv preprint arXiv:2507.03253 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-07-31T07:01:40.912045Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.900291Z"},"links":{"cited_paper":"/paper/2507.03253","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:6dcabbbb434591801b54d7449c6d0b534aa46b3ae7d961d9088c8a672c381270","observation_id":"4168c4a2-291d-43a3-a6fd-acef3dc18f4c","resolution":{"observed_at":"2026-07-31T07:01:44.900291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03253/citation-record","integrity":"/paper/2507.03253/integrity","json":"/paper/2507.03253/citation-record.json","paper":"/paper/2507.03253"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:21:49.221314Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.221314Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:140ea4de6cd2a16d33cb0885c930b6e279e1d094be6276758b472a1edc88dfc0","observation_id":"7450d016-0969-4188-afac-599e12bcdb68","resolution":{"observed_at":"2026-08-06T20:21:49.221314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:01.798269Z","title":null,"venue":null,"work_id":"0b2c5fac-2973-412f-8c61-839542907b78","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.280948Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:f6e051a94af373b5be004be20beb8545d8a287083a9e2d9c82256e1f1ad3b3fa","observation_id":"79574b7c-16fa-4f40-8ca6-671d9b6310ec","resolution":{"observed_at":"2026-08-06T20:22:01.871394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:01.636325Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"14131ba2-ae2a-4fc3-9d92-600eeceb82db","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.382321Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:4d2ac950829a76d909d170047d90f9192ce441220b6a7f9f55ee9b05f53ff914","observation_id":"8fa02c83-c199-41cc-879a-1af021779bf1","resolution":{"observed_at":"2026-08-06T20:22:01.684652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T20:21:49.508104Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.508104Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:5038df65235e66c7f9fc18333ce0c98d5e69b31eb563eb892d91fae53216c862","observation_id":"d44f2571-9608-44ad-848e-a9abfb514dac","resolution":{"observed_at":"2026-08-06T20:21:49.508104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:01.511145Z","title":"A critical analysis of the largest source for generative ai training data: Common crawl","venue":null,"work_id":"7b65de37-37cf-478a-a87f-ad7f9f89dc41","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.662920Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:758341b4155ca558576339c7a8363840b09d089f1b30b8501bb1f2de93b9cfff","observation_id":"2a620327-9de0-4ad6-8008-923297ebb377","resolution":{"observed_at":"2026-08-06T20:22:01.574642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15888","last_updated":"2025-03-20T06:26:28Z","snapshot_observed_at":"2026-07-06T20:55:51.881366Z","submitted_at":"2025-03-20T06:26:28Z","title":"Parameters vs. Context: Fine-Grained Control of Knowledge Reliance in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15888","snapshot_observed_at":"2026-08-06T20:21:49.842658Z","title":"Parameters vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.842658Z"},"links":{"cited_paper":"/paper/2503.15888","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:98c980b90a25f9c4a31baad82006d03195444f9329f5ff35d6bc1225254ecd14","observation_id":"53b6e27e-e9fe-4b74-b5df-c96e9cf58780","resolution":{"observed_at":"2026-08-06T20:21:49.842658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:49.980601Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:49.980601Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:c13ac8895ecbb594815d8e54d9ccd2383c0563a6dd14614a5956d6cd8007074f","observation_id":"90a0aa22-8055-4f12-8749-da15131acabe","resolution":{"observed_at":"2026-08-06T20:21:49.980601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:01.362335Z","title":"On the resemblance and containment of documents","venue":null,"work_id":"29d680fb-0248-4fa8-b73f-2d8f425a0204","year":1997},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:50.161331Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:e14415aae485e8854abc6f932d557f49c76013089b3588ce75086685bdc194af","observation_id":"7f531adb-7629-4bee-b65c-538d2d47463b","resolution":{"observed_at":"2026-08-06T20:22:01.424074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T20:21:50.343916Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:50.343916Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:8c3936de6f518d196943dfdb2ba936d0501e9496e4fa751b227f610d1cddc9cf","observation_id":"f50b8dbe-fa86-489f-8281-d08ba7434a6b","resolution":{"observed_at":"2026-08-06T20:21:50.343916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T20:21:50.502340Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:50.502340Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:241f7ea07271306a7a048e6c3bf61e7d8163663bb555a98f13673384b140b8b1","observation_id":"8c03c560-6257-464d-a824-1f44df122b5a","resolution":{"observed_at":"2026-08-06T20:21:50.502340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:50.621007Z","title":"Flash A ttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:50.621007Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:5902f80c7cb798cefd8bcd1322f51c03faa10f7beb8d4ac5ce19773ff998f292","observation_id":"1f456238-d246-4437-b4f1-387d691d94ce","resolution":{"observed_at":"2026-08-06T20:21:50.621007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03608","last_updated":"2024-04-04T17:31:32Z","snapshot_observed_at":"2026-08-03T21:30:50.348232Z","submitted_at":"2024-04-04T17:31:32Z","title":"Sailor: Open Language Models for South-East Asia","version":1},"cited_work":{"arxiv_id":"2404.03608","doi":"10.48550/arxiv.2404.03608","metadata_source":"pith","pith_arxiv_id":"2404.03608","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Sailor: Open Language Models for South-East Asia","venue":"cs.CL","work_id":"3440839f-c293-46a9-87cb-15400d9a68b7","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:50.740610Z"},"links":{"cited_paper":"/paper/2404.03608","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:08c325d6f5bf06279d5927fba3ef74a7ebfb856159e97be865d68ca331f025cb","observation_id":"ca42f1cc-ecfb-413a-946a-75339c94f4d8","resolution":{"observed_at":"2026-08-06T20:21:57.715855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:21:50.905266Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:50.905266Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:68f350b0d9831f63037b514720d3a98b08a09198d9a0c64397941d2aebb97721","observation_id":"00a45189-c2c1-48c3-98c3-a66350e3491d","resolution":{"observed_at":"2026-08-06T20:21:50.905266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:01.210696Z","title":"Minedojo: Building open-ended embodied agents with internet-scale knowledge","venue":null,"work_id":"c56fff0b-7fb7-425e-87d7-af1934122580","year":2022},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.070802Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:1eba6f5f07100c9304cfb1083fd1df4ee135a033527c5f85b2cef9b1a5aee104","observation_id":"b117b13d-bb9a-4808-8711-8260ab07d018","resolution":{"observed_at":"2026-08-06T20:22:01.267272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:01.078993Z","title":"Lighteval: A lightweight framework for llm evaluation, 2023","venue":null,"work_id":"3c7215ee-895d-46bd-9d89-24b1f19b5fa1","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.224440Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:fac370fcd21c5fe19356978e0117c21b862de4ebd6fa80fa0073a00e5e741dea","observation_id":"7dc05f53-411e-40c0-bacc-be4be248d23d","resolution":{"observed_at":"2026-08-06T20:22:01.120985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05999","snapshot_observed_at":"2026-08-06T20:21:51.342397Z","title":"Incoder: A generative model for code infilling and synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.342397Z"},"links":{"cited_paper":"/paper/2204.05999","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:5ab95f81a6caa76d7b14fcd5087175582741da73e7a973ed708734e22ddbeef1","observation_id":"940cbd60-b228-40c5-aa52-27d22bb6a829","resolution":{"observed_at":"2026-08-06T20:21:51.342397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:51.486728Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.486728Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:330ba061a753be0a7e54372e24811702cdd8875577c6e1361cf7160745941d9f","observation_id":"d0b5aa86-d09c-4d75-bbd7-699cf929be26","resolution":{"observed_at":"2026-08-06T20:21:51.486728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:00.896853Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions, 2023","venue":null,"work_id":"c053a59e-cdd7-4905-a3a2-2a5290b66045","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.629900Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:29f2e6206f0f449f3480c8efb843daae337edc8b458b8ce45aadedad46b7ad45","observation_id":"b30ca208-ed28-44c2-82af-2ae001040afb","resolution":{"observed_at":"2026-08-06T20:22:00.978871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:51.719872Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.719872Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:d58c5a1c345f8971d79dfe55c51ca58b924f22eaefd6fbb418c28df87b42f364","observation_id":"fc1bd634-0ab6-49a8-9a90-94e64049b0bb","resolution":{"observed_at":"2026-08-06T20:21:51.719872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-07T08:00:00.868748Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-06T20:21:51.821393Z","title":"Rho-1: Not all tokens are what you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.821393Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:0ff509162a2550de88c4323e8d5d22aa8d67b0f5542bae78015d962df5b9bcff","observation_id":"be8874e2-b0a5-42da-9f9e-cffd68cd07d8","resolution":{"observed_at":"2026-08-06T20:21:51.821393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23077","last_updated":"2025-08-13T15:48:46Z","snapshot_observed_at":"2026-07-06T21:00:46.714991Z","submitted_at":"2025-03-29T13:27:46Z","title":"Efficient Inference for Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23077","snapshot_observed_at":"2026-08-06T20:21:51.911641Z","title":"Efficient inference for large reasoning models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.911641Z"},"links":{"cited_paper":"/paper/2503.23077","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:b392fc7a90468da9030f966bd0de897a99a04f146469d24e5e2de5f6f1423c7a","observation_id":"165cd0f0-ee77-4662-8d89-b2ee17be86e4","resolution":{"observed_at":"2026-08-06T20:21:51.911641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-06T20:21:51.990657Z","title":"Openelm: An efficient language model family with open-source training and inference framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:51.990657Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:30681c435f2b745d017d7a2c7d966d198dc978ce7d9e3f1311811ec33a3f649b","observation_id":"176c9530-0d86-42cd-81b3-64832d10da35","resolution":{"observed_at":"2026-08-06T20:21:51.990657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12585","last_updated":"2024-11-12T05:09:34Z","snapshot_observed_at":"2026-08-04T05:12:44.639900Z","submitted_at":"2024-01-23T09:33:31Z","title":"SLANG: New Concept Comprehension of Large Language Models","version":6},"cited_work":{"arxiv_id":"2401.12585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12585","snapshot_observed_at":"2026-08-06T20:21:58.418336Z","title":"SLANG: New Concept Comprehension of Large Language Models","venue":"cs.CL","work_id":"5b9471f1-2870-4d25-881b-6d6e0add39b2","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.082429Z"},"links":{"cited_paper":"/paper/2401.12585","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:fc47370a71d3239f7ca98bdff8ef48fb89f65184077ca18c23958f4d59a9e8f5","observation_id":"8bebc2c8-8413-4360-9d74-d46b248dce4f","resolution":{"observed_at":"2026-08-06T20:21:58.461364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:00.690653Z","title":"Introducing meta llama 3: The most capable openly available llm to date, 2024","venue":null,"work_id":"6b697471-d248-4cb0-8881-18b1e854aaaf","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.176927Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:e81586cbe710c012c15b145d561a4b0ce7f075b8ac252cca88ce96d20fe0e5ba","observation_id":"f6c9158a-dbfe-4a3a-9b99-50336ebd57b9","resolution":{"observed_at":"2026-08-06T20:22:00.766841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:52.245731Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.245731Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:71ce8e64f647aa7cbd741a86cbf26b2e5ca1b62edc863f7e363b594c3770d464","observation_id":"9ae6e40a-e297-4276-b15c-456dbc3e33c2","resolution":{"observed_at":"2026-08-06T20:21:52.245731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11677","last_updated":"2025-06-25T13:46:10Z","snapshot_observed_at":"2026-08-03T12:46:13.938667Z","submitted_at":"2025-02-17T11:11:09Z","title":"Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11677","snapshot_observed_at":"2026-08-06T20:21:52.353944Z","title":"Towards fully exploiting llm internal states to enhance knowledge boundary perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.353944Z"},"links":{"cited_paper":"/paper/2502.11677","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:efe3fd5907204fcf31ce9792f281c884a605e7115a867ebf07ad6d78b1656916","observation_id":"aa198cee-3b96-4822-b4c5-75c112b9d7d1","resolution":{"observed_at":"2026-08-06T20:21:52.353944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:52.474419Z","title":"Generative agents: Interactive simulacra of human behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.474419Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:71a06dd3b960d3df0b5adfda3bed93e42ce490a4ed8308569039542fee318d14","observation_id":"5b978836-5c46-4da4-a3f6-08f365f46dad","resolution":{"observed_at":"2026-08-06T20:21:52.474419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-06T20:21:52.628204Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.628204Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:09bc627200e4ac65a17707a75336a60f98655f5acf4566ddee21e6892801de65","observation_id":"3be0ad10-5659-45d7-85d6-078a19e0f096","resolution":{"observed_at":"2026-08-06T20:21:52.628204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:00.524385Z","title":"Datatrove: large scale data processing, 2024 b","venue":null,"work_id":"16b477ce-3cce-489e-9daf-876f3e2e5f26","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.744819Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:ba3460ffec8d4de1d199820300b5a7509e9ce6a2715d89d6247ded89867647c0","observation_id":"3b214c50-b851-4640-a7d8-d2f1d12bb48b","resolution":{"observed_at":"2026-08-06T20:22:00.595823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:00.276567Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data only","venue":null,"work_id":"82a34dae-f347-48c5-bcdc-03e1450ec3a3","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:52.879117Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:a0eabc1a336e22d113eab2a6cd9833aedf73a3b75ec6b566d021b4c09ea44f64","observation_id":"ef8dcdae-7b02-4ae4-b247-3dc043503be2","resolution":{"observed_at":"2026-08-06T20:22:00.412211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19363","last_updated":"2025-04-08T03:21:10Z","snapshot_observed_at":"2026-07-06T20:43:13.475673Z","submitted_at":"2025-02-26T18:01:19Z","title":"DataMan: Data Manager for Pre-training Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19363","snapshot_observed_at":"2026-08-06T20:21:53.021981Z","title":"Dataman: Data manager for pre-training large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.021981Z"},"links":{"cited_paper":"/paper/2502.19363","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:dfa94f95bb4a2b91f015102ae91b34b12849c652801407a71f595c217602fdd6","observation_id":"e2972caf-9d02-45b9-b472-b5c476447db3","resolution":{"observed_at":"2026-08-06T20:21:53.021981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-06T20:21:53.148940Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.148940Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:0a6f167221594043855ef6f14f0edc2c21b2c19f3c21c66053b942903f7565f0","observation_id":"2b88ea0e-48fe-48ed-a7a7-911089c81335","resolution":{"observed_at":"2026-08-06T20:21:53.148940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:53.276242Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.276242Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:5421746995e8c3a35018e32857eee4c8cf722655c8fd809aec860724c6792239","observation_id":"df44e4de-4cbc-40f9-944c-b146bd7f49f8","resolution":{"observed_at":"2026-08-06T20:21:53.276242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:22:00.087324Z","title":"Web data mining with organized contents using naive bayes algorithm","venue":null,"work_id":"5007b4f3-61d7-4ec1-87f5-917acdd7e3cc","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.406768Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:859ce8ac20ef4bb274c7aa17ef16392497e0fe6343f3b4ca6b163beef6df29b7","observation_id":"9babaecc-3f96-47d9-8570-8ce6e469ea9c","resolution":{"observed_at":"2026-08-06T20:22:00.139969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:53.567288Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.567288Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:ab9a3dbb350c33ea72df8a195365a381529b7ec7edbc77182e1c07a13e2feb48","observation_id":"4fea4167-8318-4f55-8c65-2fc992a212fc","resolution":{"observed_at":"2026-08-06T20:21:53.567288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-06T20:21:53.691167Z","title":"Socialiqa: Commonsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.691167Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:08a7a1865d7df0b2401f956dc50de076fccaa2276f874d853c18bc36244f4a63","observation_id":"de97d225-d551-42fc-9daf-9ec83628ca63","resolution":{"observed_at":"2026-08-06T20:21:53.691167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:59.933753Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"4af8c66b-eac1-4a15-8a04-8403cf3b6a85","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.844678Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:f264c5de002e41454566f321e977ebe24a3dcb6d3e4031c724122e1b98bcd54e","observation_id":"75c4317c-ccea-4174-a1ff-5c9aa60e5590","resolution":{"observed_at":"2026-08-06T20:22:00.002087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T20:21:53.998507Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:53.998507Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:2416dda567577fff8afd9c3477a11612fbfcd213630457155fe364c63945e70a","observation_id":"9621e435-1282-4009-87e8-92e5d1623dc4","resolution":{"observed_at":"2026-08-06T20:21:53.998507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:59.690483Z","title":"SlimPajama: A 627B token cleaned and deduplicated version of RedPajama , June 2023","venue":null,"work_id":"da888041-3c4c-4ebe-83f0-f296661d4b6e","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.173260Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:380b6cfe82f665907755dc2b2f913be822fb4f5a832e25454699c5346cf2e5a2","observation_id":"4e0e0e2c-b9bb-4f69-897c-f218fddc8c6f","resolution":{"observed_at":"2026-08-06T20:21:59.833764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:59.477430Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":"887000d5-2383-4344-bf6e-41dbaa9f4c04","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.325158Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:2da6a5deedaff1fa2a9f2bced1446089edfa4a5cfd5c2b91584da724e4560dce","observation_id":"f9a3b0d5-5a17-4bd4-a6da-0334819f2b0c","resolution":{"observed_at":"2026-08-06T20:21:59.545747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-06T20:21:54.439779Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.439779Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:9033589cb914ee511891a1c20d9a287dd22cc8121223b47274935a3ab1bf7e77","observation_id":"34c86beb-14da-4524-bff9-e9b876b99569","resolution":{"observed_at":"2026-08-06T20:21:54.439779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:54.624141Z","title":"C ommonsense QA : A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.624141Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:8a257e73c83c68d7c4f7076caafe7ec03b6762f3830ec53abd9d8ce406b13df4","observation_id":"3e3606bc-1499-4c96-8dd5-121609bd9e60","resolution":{"observed_at":"2026-08-06T20:21:54.624141Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:59.318647Z","title":"Redpajama: an open dataset for training large language models, October 2023","venue":null,"work_id":"5cacf21f-17d3-4a05-b9d5-69a212d749e4","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.781545Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:35dcb046b3b17070dc8f42876e1a597645912ecad5b54b2ccd015c924e697d18","observation_id":"5b1017bf-c110-4a24-9483-2bccce464167","resolution":{"observed_at":"2026-08-06T20:21:59.401589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:59.111228Z","title":"M Towhidul Islam Tonmoy, S M Mehedi Zaman, Vinija Jain, Anku Rani, Vipula Rawte, Aman Chadha, and Amitava Das","venue":null,"work_id":"9a733ed4-cb2a-4486-8e7d-baeb0911dd8e","year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.951767Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:6cc953baecaaecdbc32db15388eb6b2371b4f0069aa3df13bc3adf705e97cea5","observation_id":"0e9793d1-3fec-4858-a7bf-134458de5c9b","resolution":{"observed_at":"2026-08-06T20:21:59.219332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:21:55.088543Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.088543Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:ef1d2a44412cae981808d94f27ccaeae69ae4c79986f9e6c0e77605756271f9b","observation_id":"8738f8af-7e15-4c73-8233-0a045088789e","resolution":{"observed_at":"2026-08-06T20:21:55.088543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:21:55.236194Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.236194Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:f0e1de938b9660905d25feb133e06991ce9ed0a5213e9434244573df1b42bb4f","observation_id":"5d90a520-0610-4b87-af93-cbc33ab5fd3e","resolution":{"observed_at":"2026-08-06T20:21:55.236194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T20:21:55.411568Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.411568Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:0a74db975d63dc0115613b76f48d9a079c5e517f0be2964c1f4aac45f7a1ed47","observation_id":"c47027db-4378-4261-9fd5-3943afbc1431","resolution":{"observed_at":"2026-08-06T20:21:55.411568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:55.555671Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.555671Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:e0f11554ebd8fe10f4443bb0d3a22f7682a181bbbafd0fcdb5629635b9d87945","observation_id":"41e22c1e-de88-4907-9578-997b904eb7bf","resolution":{"observed_at":"2026-08-06T20:21:55.555671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-06T20:21:55.665550Z","title":"Crowdsourcing multiple choice science questions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.665550Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:c9fa05ba2d935fb27ddc34f7e50b485ea9efa15b1b4d3e8eb8dafd19107f6588","observation_id":"7f417b6c-ba9a-4484-8601-42c4466c8828","resolution":{"observed_at":"2026-08-06T20:21:55.665550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:55.821166Z","title":"QuRating : Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.821166Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:7ad6b1961aa6213459e887013dba684701bb25aa9fdf66fe11d93082586f6069","observation_id":"594b4f42-1bf6-46a6-9157-bd1f6a7078d3","resolution":{"observed_at":"2026-08-06T20:21:55.821166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:55.957694Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:55.957694Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:c837d1667a307e58b1dc58c0da532989b974672abd4fb4152de76052b1c79f29","observation_id":"c19a7082-0c5e-4986-893e-1ed92657c4fb","resolution":{"observed_at":"2026-08-06T20:21:55.957694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T20:21:56.118676Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.118676Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:3e7a0ea177fc83830161eb2edcf6e9fa42798020f374331e3f8e6f1a47d28794","observation_id":"692d263e-4ffd-4a57-a9c3-087be751aa98","resolution":{"observed_at":"2026-08-06T20:21:56.118676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:58.899099Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"959072c7-5c93-4c39-912d-d35711a6903f","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.290379Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:0990edd981bd58da5926c28812be734670076b01b2996b99d3218163227a3dae","observation_id":"8d2a5181-c345-4c75-a198-2b59d2c5aafd","resolution":{"observed_at":"2026-08-06T20:21:58.985198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13347","last_updated":"2025-06-23T02:24:30Z","snapshot_observed_at":"2026-08-05T08:45:41.033180Z","submitted_at":"2025-02-19T00:31:43Z","title":"Craw4LLM: Efficient Web Crawling for LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2502.13347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13347","snapshot_observed_at":"2026-08-06T20:21:58.077404Z","title":"Craw4LLM: Efficient Web Crawling for LLM Pretraining","venue":"cs.CL","work_id":"e2a92c2e-d8f9-4ae1-ad30-b198545d0081","year":2025},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.432140Z"},"links":{"cited_paper":"/paper/2502.13347","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:559899a32569747241e3e8f1b2738f5abf521ad19e7c211dde415aac402aa3d1","observation_id":"591e6031-5101-4b14-9a15-3885759666b3","resolution":{"observed_at":"2026-08-06T20:21:58.169963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-06T20:21:56.521904Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.521904Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:3bc348ee4b73160f4873d25bd0fbd473e907aa77a051c6e4ed0e7fd3f82d6bd5","observation_id":"f3e0ccfe-6668-4d09-b5f5-7a27ce0e6b6c","resolution":{"observed_at":"2026-08-06T20:21:56.521904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:58.722187Z","title":"A normalized levenshtein distance metric","venue":null,"work_id":"c1c90223-74be-4390-a803-b4fa0f9b6789","year":2007},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.621387Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:dedb14d9727115295a190a4fa36afcafb241d2ba36c5ce772fd8e0a28eaeeb3e","observation_id":"ef9f0231-9922-4d4c-b621-f86de036139a","resolution":{"observed_at":"2026-08-06T20:21:58.795332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-06T20:21:56.705569Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.705569Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:338d0b384cab64487d2333ba2ceb33fdfc8de7a2fce6ed4587813b7f4003e5cf","observation_id":"ef6a9a63-4feb-4fd4-a5d0-f95b4d1712c8","resolution":{"observed_at":"2026-08-06T20:21:56.705569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19327","last_updated":"2024-07-10T16:55:47Z","snapshot_observed_at":"2026-08-06T06:05:02.911714Z","submitted_at":"2024-05-29T17:57:16Z","title":"MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19327","snapshot_observed_at":"2026-08-06T20:21:56.774069Z","title":"Map-neo: Highly capable and transparent bilingual large language model series","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.774069Z"},"links":{"cited_paper":"/paper/2405.19327","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:e99768a9b2a4ff7d73143014a1b2c35cac5468d85070c0491dfecb651268aba5","observation_id":"5f4e0736-afbd-453c-b5bd-4f278a120af5","resolution":{"observed_at":"2026-08-06T20:21:56.774069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-06T20:21:56.820599Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.820599Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:bd82a7532967d0f06585e6842d5f42a366e079a4b948028561f2017817a2a71a","observation_id":"624fcccf-52f1-410b-b0ad-ff0eb381e3a4","resolution":{"observed_at":"2026-08-06T20:21:56.820599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11603","last_updated":"2023-10-17T21:54:24Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T21:54:24Z","title":"Group sequential two-stage preference designs","version":1},"cited_work":{"arxiv_id":"2310.11603","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.11603","snapshot_observed_at":"2026-08-06T20:21:57.913556Z","title":"Group sequential two-stage preference designs","venue":"stat.ME","work_id":"1e115150-c754-4976-b1b7-5f91a9a95991","year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.870666Z"},"links":{"cited_paper":"/paper/2310.11603","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:9f8f0bc731949f991ae9aeb9e76349419f01591cbe2257cf172f735d46915c5b","observation_id":"aa86406b-5afc-4594-8f49-03318f5ca37f","resolution":{"observed_at":"2026-08-06T20:21:57.960452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:56.984969Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.984969Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:7fb38116b62deb50f7982fb05b03ca3c4db739226edefadb71d48f3ebc5e48fd","observation_id":"4edcb21a-6b65-423f-b4b2-e5c30134afc4","resolution":{"observed_at":"2026-08-06T20:21:56.984969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17115","last_updated":"2025-02-14T16:44:08Z","snapshot_observed_at":"2026-07-06T19:22:14.655041Z","submitted_at":"2024-09-25T17:28:13Z","title":"Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17115","snapshot_observed_at":"2026-08-06T20:21:57.043953Z","title":"Programming every example: Lifting pre-training data quality like experts at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.043953Z"},"links":{"cited_paper":"/paper/2409.17115","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:347b20ec40d4a8d7b4ef7b1b215d419ad9c52c76681c29d3d286472d798cb784","observation_id":"28521949-bc86-410a-9636-6117c73de4e8","resolution":{"observed_at":"2026-08-06T20:21:57.043953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:57.113184Z","title":"Toolqa: A dataset for llm question answering with external tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.113184Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:6c42f9974972ede14c313b6d4be5a785574be12967ad8212ab01af1a92f7c415","observation_id":"d743a0a9-bce4-4c02-ad0f-4ad39613fae5","resolution":{"observed_at":"2026-08-06T20:21:57.113184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-06T20:21:57.219298Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.219298Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:e697b27b35f356e643c0953f895b01bcfdea4a200f8e75b51f5807b473a69f29","observation_id":"2954b039-d9ba-498e-9796-f1ae509ed60c","resolution":{"observed_at":"2026-08-06T20:21:57.219298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:57.288915Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.288915Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:f6159d779c692e4f213906bbbb582d5ceffb010d7b6268c7dead0baf5cf2c2b5","observation_id":"3e516554-032e-4ad8-82c6-58e530a47110","resolution":{"observed_at":"2026-08-06T20:21:57.288915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:57.374148Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.374148Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:c479433f295caf202e5f12a69f76879339ac58d3ee30ef156d05a0753d83a6d2","observation_id":"eee9aea3-38cd-472f-aa59-e505ecafc354","resolution":{"observed_at":"2026-08-06T20:21:57.374148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:57.452061Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.452061Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:b3aed3b52ad35021303afddff80654531e0ce401cba87458e6033f9b6239954b","observation_id":"71fe0797-da08-430e-a29c-a50b5cbc428a","resolution":{"observed_at":"2026-08-06T20:21:57.452061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:21:57.501475Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:57.501475Z"},"links":{"citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:d344a616008e7159fc8b880c28ab54764b494e4ac2d72477bb1a73ecc44363f8","observation_id":"9887537d-4395-4cc1-8b67-4b122c5a6293","resolution":{"observed_at":"2026-08-06T20:21:57.501475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":46,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 2 inbound Pith citation observations for arXiv:2507.03253."}