{"as_of":"2026-08-08T02:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd85086a0e546312f74f9daa8a5a84519a1ce847f2f0b5546c447764d4a8c68e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:00.682538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T20:33:43.447108Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":"2401.12926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engstrom, A","venue":null,"work_id":"55cb8579-ee45-42a8-a30d-bb726c708848","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":284,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:66cca73a8dfeeb252a3d15f8a9e8bff794c3e870b8fb3aa36236e3328f1cd129","observation_id":"6b856bf7-b7cc-4627-9606-af4c87fa031a","resolution":{"observed_at":"2026-05-19T08:02:23.896133Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T15:43:00.682538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.682538Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:93fc48183174d1575c6941ff56d1d739fe7ed884ca78e92b68dcf74f90c2d2ec","observation_id":"9cc5d988-5440-46bb-b397-31bf1a3acbb4","resolution":{"observed_at":"2026-08-07T15:43:00.682538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T15:09:34.266453Z","title":"Dsdm: Model-aware dataset selection with datamodels.arXiv preprint arXiv:2401.12926, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16066","last_updated":"2025-05-21T22:34:13Z","snapshot_observed_at":"2026-08-07T15:05:27.211434Z","submitted_at":"2025-05-21T22:34:13Z","title":"Merge to Mix: Mixing Datasets via Model Merging","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:34.266453Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.16066"},"observation_digest":"sha256:ac749763e775ed41247ea9b80b7516b6c169580d997c737988cf8f25b15a62b3","observation_id":"9d214e5b-9161-4edf-926b-d016098bda57","resolution":{"observed_at":"2026-08-07T15:09:34.266453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T14:33:13.043484Z","title":"Engstrom, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18458","last_updated":"2025-06-01T16:00:34Z","snapshot_observed_at":"2026-08-07T20:59:19.597449Z","submitted_at":"2025-05-24T01:57:12Z","title":"A Survey of LLM $\\times$ DATA","version":3},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.043484Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.18458"},"observation_digest":"sha256:358ec99b7a434895d06a76c6b6312b7660e762711dcf8094b83a78a1dc40aac2","observation_id":"fe08a020-a8fb-4877-b4d9-ec116dc9c03b","resolution":{"observed_at":"2026-08-07T14:33:13.043484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T14:25:18.604677Z","title":"Dsdm: Model-aware dataset selection with datamodels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-07T22:50:03.044224Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.604677Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:9dc5f61b86f8e0a34e2e7920edf1e4f8263f86836fd45a1c0968f04c2b147ffd","observation_id":"bb7a900b-430a-47e6-9e52-c239a7a5ec99","resolution":{"observed_at":"2026-08-07T14:25:18.604677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-06T23:58:59.399365Z","title":"Dsdm: Model-aware dataset selection with datamodels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15553","last_updated":"2025-06-18T15:26:43Z","snapshot_observed_at":"2026-08-06T23:51:02.952534Z","submitted_at":"2025-06-18T15:26:43Z","title":"Approximating Language Model Training Data from Weights","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:58:59.399365Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2506.15553"},"observation_digest":"sha256:4d106febeca9820068e3f2d31dcdc04d7cb9ddf6a23e9d6fecf425a749ebb211","observation_id":"4de0d262-14d4-461d-9963-64712db86c6f","resolution":{"observed_at":"2026-08-06T23:58:59.399365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-06T15:21:57.354915Z","title":"org/abs/2401.12926,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16178","last_updated":"2025-07-22T02:47:12Z","snapshot_observed_at":"2026-08-06T15:14:23.580355Z","submitted_at":"2025-07-22T02:47:12Z","title":"LLM Data Selection and Utilization via Dynamic Bi-level Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:21:57.354915Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2507.16178"},"observation_digest":"sha256:7a22b2b3d7c6342b7944e784425cf59b07f94476b67c03a4455b711bd32af3a3","observation_id":"e1f7f25b-9568-4247-8625-65dc0d06be9e","resolution":{"observed_at":"2026-08-06T15:21:57.354915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-04T11:16:09.373454Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.373454Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:d3120c4d736f7966c7ec0dc4160a992b0d9400bf1cde2b9c3a8a692113970d8d","observation_id":"385ed274-c754-4dbf-865f-e158358dc084","resolution":{"observed_at":"2026-08-04T11:16:09.373454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-02T21:05:24.801158Z","title":"Dsdm: Model-aware dataset selection with datamodels.ArXiv, abs/2401.12926,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21492","last_updated":"2026-07-18T04:56:29Z","snapshot_observed_at":"2026-08-04T06:06:14.689327Z","submitted_at":"2026-02-25T01:54:50Z","title":"GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:05:24.801158Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2602.21492"},"observation_digest":"sha256:37651e9a6fbb7a7983532a7edd0a4d0bfc302b96f129d758d5ed6af50fb39ab0","observation_id":"a785c640-019b-43a0-a0b7-0f4f91be0f90","resolution":{"observed_at":"2026-08-02T21:05:24.801158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":"2401.12926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engstrom, A","venue":null,"work_id":"55cb8579-ee45-42a8-a30d-bb726c708848","year":2024},"citing_paper":{"arxiv_id":"2604.07769","last_updated":"2026-04-09T03:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T03:48:11Z","title":"An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:13:24.750244Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2604.07769"},"observation_digest":"sha256:3a419536a1a5c6b62108dab93999b0e4605ea97fa3b4a80790ff4c8c8afe7570","observation_id":"209fb072-7979-4fe0-94fc-b6a668c5c941","resolution":{"observed_at":"2026-05-11T05:16:04.642127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":"2401.12926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engstrom, A","venue":null,"work_id":"55cb8579-ee45-42a8-a30d-bb726c708848","year":2024},"citing_paper":{"arxiv_id":"2604.08519","last_updated":"2026-04-09T17:55:50Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:55:50Z","title":"Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T17:42:31.465077Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2604.08519"},"observation_digest":"sha256:eb4a8375c9acddd03d87508e3809485da1b81123577f488a6300b85fbb163abe","observation_id":"ed979582-81f9-49b1-901b-e681d5a45bae","resolution":{"observed_at":"2026-05-11T06:15:58.953196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":"2401.12926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engstrom, A","venue":null,"work_id":"55cb8579-ee45-42a8-a30d-bb726c708848","year":2024},"citing_paper":{"arxiv_id":"2605.15691","last_updated":"2026-05-15T07:26:54Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T07:26:54Z","title":"SEED: Targeted Data Selection by Weighted Independent Set","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:26.760966Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2605.15691"},"observation_digest":"sha256:1f0813b15ccca37651cd2b9a1ef3554357105b83dc2723caab108ed6eb72525a","observation_id":"46b2b631-64f8-441f-bc51-fbf3994a2044","resolution":{"observed_at":"2026-05-20T20:33:43.448407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-07-31T07:01:45.810159Z","title":"arXiv preprint arXiv:2401.12926 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-08T00:53:22.078848Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.810159Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:b4fb8cce896b2c36025c68575863c657ea70b2769ed9af54e1e359462175e2dd","observation_id":"e3753590-e1a4-4193-9728-0977d9561cc1","resolution":{"observed_at":"2026-07-31T07:01:45.810159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.12926/citation-record","integrity":"/paper/2401.12926/integrity","json":"/paper/2401.12926/citation-record.json","paper":"/paper/2401.12926"},"outbound":[],"paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2401.12926."}