{"as_of":"2026-08-09T02:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65b4a355b1afe7f3618863a886c0ab33273f2454472a35d86530aad3d2d264f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:21:56.521904Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.405954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-06T20:21:56.521904Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:56.521904Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:3bc348ee4b73160f4873d25bd0fbd473e907aa77a051c6e4ed0e7fd3f82d6bd5","observation_id":"f3e0ccfe-6668-4d09-b5f5-7a27ce0e6b6c","resolution":{"observed_at":"2026-08-06T20:21:56.521904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-06T15:21:58.101569Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16178","last_updated":"2025-07-22T02:47:12Z","snapshot_observed_at":"2026-08-06T15:14:23.580355Z","submitted_at":"2025-07-22T02:47:12Z","title":"LLM Data Selection and Utilization via Dynamic Bi-level Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:21:58.101569Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2507.16178"},"observation_digest":"sha256:53ba7e89c6db851322701c3f0cbf065b76953ec7ad394d905857af7c7e05ce5f","observation_id":"c91ef90a-3734-44ab-832d-846d511e3051","resolution":{"observed_at":"2026-08-06T15:21:58.101569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-04T11:16:15.281996Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.281996Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:ad6557562bd450f3da2ebc30bb912d55ebd8ee98e7016e8aa8ee77baf9d5d336","observation_id":"0ac98bfb-6693-4547-848f-59cec9b21172","resolution":{"observed_at":"2026-08-04T11:16:15.281996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-02T21:05:26.804742Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence mod- els.ArXiv, abs/2406.06046,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21492","last_updated":"2026-07-18T04:56:29Z","snapshot_observed_at":"2026-08-04T06:06:14.689327Z","submitted_at":"2026-02-25T01:54:50Z","title":"GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:05:26.804742Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2602.21492"},"observation_digest":"sha256:8adf1c2a55af3bc9374dba8c41d87e84eb8cf1cd4ef063770daccad62f0e0300","observation_id":"668e404a-e66a-4f73-8486-a25ecaa60f98","resolution":{"observed_at":"2026-08-02T21:05:26.804742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":"2406.06046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-07-03T16:48:39.405954Z","title":"Jiaqi Zhai, Lucy Liao, Xing Liu, Yueming Wang, Rui Li, Xuan Cao, Leon Gao, Zhaojie Gong, Fangda Gu, Jiayuan He, et al","venue":null,"work_id":"a10cdd7f-1720-4103-a466-a9e8600a9fa0","year":2024},"citing_paper":{"arxiv_id":"2604.07739","last_updated":"2026-04-09T02:48:52Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T02:48:52Z","title":"Efficient Dataset Selection for Continual Adaptation of Generative Recommenders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:13:46.622289Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2604.07739"},"observation_digest":"sha256:08dd25ec3759b6c19d7d28bb781c7cabad0dfb9abe8d4daaaea6bf9ccacf4912","observation_id":"05bae7ed-8f67-43e1-87cf-22af4b88def0","resolution":{"observed_at":"2026-05-11T05:16:03.771646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":"2406.06046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-07-03T16:48:39.405954Z","title":"Jiaqi Zhai, Lucy Liao, Xing Liu, Yueming Wang, Rui Li, Xuan Cao, Leon Gao, Zhaojie Gong, Fangda Gu, Jiayuan He, et al","venue":null,"work_id":"a10cdd7f-1720-4103-a466-a9e8600a9fa0","year":2024},"citing_paper":{"arxiv_id":"2604.07769","last_updated":"2026-04-09T03:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T03:48:11Z","title":"An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:13:24.750244Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2604.07769"},"observation_digest":"sha256:710047ae92944c10cc012bd29284b6b83cbb8a1e695f08781dd4b74e8ab3d332","observation_id":"d6b18352-4ab4-49ea-87fd-1b67c952ec14","resolution":{"observed_at":"2026-05-11T05:16:04.521623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":"2406.06046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-07-03T16:48:39.405954Z","title":"Jiaqi Zhai, Lucy Liao, Xing Liu, Yueming Wang, Rui Li, Xuan Cao, Leon Gao, Zhaojie Gong, Fangda Gu, Jiayuan He, et al","venue":null,"work_id":"a10cdd7f-1720-4103-a466-a9e8600a9fa0","year":2024},"citing_paper":{"arxiv_id":"2604.11810","last_updated":"2026-04-09T14:08:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:08:01Z","title":"GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:46.131725Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2604.11810"},"observation_digest":"sha256:d31a7e41f6fa4b995818e590fd9de4af79c3118794f0eb2f4ad6430b5ed898a8","observation_id":"c1e8c891-7e22-489a-89ba-d09753bbf189","resolution":{"observed_at":"2026-05-11T05:30:57.980667Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":"2406.06046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-07-03T16:48:39.405954Z","title":"Jiaqi Zhai, Lucy Liao, Xing Liu, Yueming Wang, Rui Li, Xuan Cao, Leon Gao, Zhaojie Gong, Fangda Gu, Jiayuan He, et al","venue":null,"work_id":"a10cdd7f-1720-4103-a466-a9e8600a9fa0","year":2024},"citing_paper":{"arxiv_id":"2604.16197","last_updated":"2026-07-19T20:58:40Z","snapshot_observed_at":"2026-08-07T01:48:38.832815Z","submitted_at":"2026-04-17T16:07:11Z","title":"Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T08:47:36.122054Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2604.16197"},"observation_digest":"sha256:3dd86ff11510aa2435a0730d1b5f77b05bda6db52df2a530a5f59aeba1529e7d","observation_id":"030ce241-3d36-4241-873b-1a6b7690c8b4","resolution":{"observed_at":"2026-05-10T08:48:00.969572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-02T16:12:13.358123Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.16197","last_updated":"2026-07-19T20:58:40Z","snapshot_observed_at":"2026-08-07T01:48:38.832815Z","submitted_at":"2026-04-17T16:07:11Z","title":"Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T16:12:13.358123Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2604.16197"},"observation_digest":"sha256:b2904d2ac5da2333537c15a1ac5d57ee5e9cfbb9b840b9fdbd5e8e73d2b3d51e","observation_id":"1205b449-a336-4516-8c77-888553e55417","resolution":{"observed_at":"2026-08-02T16:12:13.358123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":"2406.06046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-07-03T16:48:39.405954Z","title":"Jiaqi Zhai, Lucy Liao, Xing Liu, Yueming Wang, Rui Li, Xuan Cao, Leon Gao, Zhaojie Gong, Fangda Gu, Jiayuan He, et al","venue":null,"work_id":"a10cdd7f-1720-4103-a466-a9e8600a9fa0","year":2024},"citing_paper":{"arxiv_id":"2607.02266","last_updated":"2026-07-02T14:51:42Z","snapshot_observed_at":"2026-08-08T15:31:37.930459Z","submitted_at":"2026-07-02T14:51:42Z","title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-03T16:44:41.720388Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2607.02266"},"observation_digest":"sha256:588d3e9a33acd48843b5335147ed16208fbff8f328b3e3fdab99e3239f696cd7","observation_id":"b3ced776-83bb-45e9-a0c6-bb99289f2fde","resolution":{"observed_at":"2026-07-03T16:48:39.407393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.06046/citation-record","integrity":"/paper/2406.06046/integrity","json":"/paper/2406.06046/citation-record.json","paper":"/paper/2406.06046"},"outbound":[],"paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T19:54:48.818592Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2406.06046."}