{"as_of":"2026-08-08T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3a0992a90f8785e7b95afa8172e7b87f81d7dc93cc3539b786025ee665be76d","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:04.846398Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.14070/citation-record","integrity":"/paper/2505.14070/integrity","json":"/paper/2505.14070/citation-record.json","paper":"/paper/2505.14070"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.059812Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.059812Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7bf9ea0752b2c5883b806562d38ecb35a489da33ca94f319905af5be9c224c07","observation_id":"a74eaf21-8783-473a-a6e8-20a611ea55b7","resolution":{"observed_at":"2026-08-07T15:42:59.059812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.290765Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.290765Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:1953f46df4b7611e30aaaaeee213463aaeafd70f1464e2a0bf3d88ef8b153ee5","observation_id":"de9173a3-8cf8-4534-a6d9-790eee4a79a2","resolution":{"observed_at":"2026-08-07T15:42:59.290765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:42:59.426510Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.426510Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7236e76d1dcc049f24b14d78887aafab3b7712ea0346a88271c916cfd4acf698","observation_id":"dea282dd-61b9-44bb-9d6b-a41f143b230f","resolution":{"observed_at":"2026-08-07T15:42:59.426510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T15:42:59.545380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.545380Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:f93146b5e60ece0ecd47195a1758839cc3d23b94e9fdfab2d80c069ec3b6f253","observation_id":"dae8452d-0891-4b6e-8f99-e09d2dee3682","resolution":{"observed_at":"2026-08-07T15:42:59.545380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:12.141416Z","title":null,"venue":null,"work_id":"8b531288-77dd-4b75-a448-35c8f4f3bf77","year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.680870Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:1dfaddeee3f5e0e7bc21b6e74c568480c3433105339b938cde39494307910c75","observation_id":"0c904954-3672-488c-8344-c9647082f6e5","resolution":{"observed_at":"2026-08-07T15:43:12.215284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.748628Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.748628Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:124a2c13b2306842f3de30e3150cf6fbac64f84c4ffe32095f5a7a1bb3f4f01d","observation_id":"e98dc18b-d567-41d8-bb92-b9358dc1bcf6","resolution":{"observed_at":"2026-08-07T15:42:59.748628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T15:42:59.855294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.855294Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:ff3e53046205cdd1dee32b6103f83725022034af476cd5befb2c0eeb1f2f53ef","observation_id":"77d66440-fb24-4feb-971f-ed412cf8d90a","resolution":{"observed_at":"2026-08-07T15:42:59.855294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.002986Z","title":"W.; Sutton, C.; Gehrmann, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.002986Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:df7b368198b0a0c4e4222b4d599b2208ba232fcffcffa00cef6fd3126556b688","observation_id":"0c81c93e-7710-46ac-a2c9-d6889e74cde4","resolution":{"observed_at":"2026-08-07T15:43:00.002986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.914443Z","title":null,"venue":null,"work_id":"e6ade9d2-3c5c-488c-8495-d6cf26d1fecc","year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.117674Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:4c04efa43f768a44791b2c146f62fe3b59633dc8135f0bd84719c4bcf0283acd","observation_id":"4540a079-92af-4088-9db1-5f8ea201ac6a","resolution":{"observed_at":"2026-08-07T15:43:11.997009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.285708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.285708Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:8690b4844fdf872f547ca5ecb3f163cdcd1c94d9e512ad594e36dd0c0e49d195","observation_id":"7ce181cf-8469-4ae6-86d1-c9aa8b206eb1","resolution":{"observed_at":"2026-08-07T15:43:00.285708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.617993Z","title":null,"venue":null,"work_id":"dcbc5e8b-f3f5-48ba-a3f5-23920a2aafb2","year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.420056Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7c86909ea0ec5cb08a554c8b006ccd471a326cad7b5a1a6465010245416d6628","observation_id":"d2a2fbe9-e970-4ed8-9961-32edd9851b99","resolution":{"observed_at":"2026-08-07T15:43:11.720339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T15:43:00.461370Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.461370Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:9681ae4babdc4aeb8a8be760eef81839784b6254900baefd356baca900e91277","observation_id":"bdc2d005-aef0-40b1-9007-da1237be39e5","resolution":{"observed_at":"2026-08-07T15:43:00.461370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:43:00.538354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.538354Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:2192d1fe3ace8b82d66631431116103f70fb97cc80512f501d50c9ae966dbe27","observation_id":"a3981686-3563-44c3-accf-e9815538bd1a","resolution":{"observed_at":"2026-08-07T15:43:00.538354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T15:43:00.682538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.682538Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:93fc48183174d1575c6941ff56d1d739fe7ed884ca78e92b68dcf74f90c2d2ec","observation_id":"9cc5d988-5440-46bb-b397-31bf1a3acbb4","resolution":{"observed_at":"2026-08-07T15:43:00.682538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T15:43:00.756224Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.756224Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:f5d51ac6043e3daf4a05124fd95bc5fa9ebcdcc9f993cf6f4012b17fa4100541","observation_id":"4728e35d-6899-483a-af08-9db810c0debe","resolution":{"observed_at":"2026-08-07T15:43:00.756224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.378725Z","title":null,"venue":null,"work_id":"484924fb-033b-4fad-b9e3-22a930c1fee9","year":2001},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.831445Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:1842b956ebcf28002ea470bd1df8fca1b87960ea825c840702144f872df25aec","observation_id":"3e1c8cc5-8555-41b8-8f23-9e301889eddd","resolution":{"observed_at":"2026-08-07T15:43:11.494761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.129588Z","title":null,"venue":null,"work_id":"46607399-3c6a-49b1-bb11-106476b4930c","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.916658Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:173239f3a13b3fab28339cc070d00af71e3fb2dd0cc0326c8baf6c185caffee4","observation_id":"f4cff796-064c-4289-a458-672a1fd77947","resolution":{"observed_at":"2026-08-07T15:43:11.236160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:43:01.019419Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.019419Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:09d4a15550b1de18b357c6356fe5535457fade8281369f709088807784c4c2a0","observation_id":"0014f397-4dfe-448c-afe4-32285fcf2226","resolution":{"observed_at":"2026-08-07T15:43:01.019419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T15:43:01.132790Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.132790Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7e491dc434a7b3dd3d79ccc04a17fdc4c561f8ce3043d8254b1c835bb5aea420","observation_id":"6366c2eb-03db-4182-a53f-1a3780e10858","resolution":{"observed_at":"2026-08-07T15:43:01.132790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-07T15:43:01.256515Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.256515Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:44787bff35fe5bb20e6ea4cdcba49d6eb4975877b27209711cc9ff8853910106","observation_id":"a0f12529-6f58-4a8a-bca3-10fc5ef34ae8","resolution":{"observed_at":"2026-08-07T15:43:01.256515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-07T23:54:46.322439Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-07T15:43:01.352243Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.352243Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:c0c80dcdfc03b2626f372cc4d91aaef6977e7be08c553bfa75947023888df541","observation_id":"ad171979-523b-48c6-8f1b-e67f911f71c7","resolution":{"observed_at":"2026-08-07T15:43:01.352243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.837339Z","title":null,"venue":null,"work_id":"e0d2d288-7b0e-40b5-93fc-e6adab0983f1","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.500087Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:b4f2e000da6ccf4dea65fd28f22b1518b4025f21baf8a0db433131ab10326f2a","observation_id":"91b152bf-6224-4149-8a0d-0fc2d15fe479","resolution":{"observed_at":"2026-08-07T15:43:10.995012Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.576076Z","title":null,"venue":null,"work_id":"b6cfdcb9-7615-47fe-a772-0d823364fc6e","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.607046Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:3be61f7aa801b98f14d728d0c87fc8445cb57f5dbe313cd7365dbaecdccc13ff","observation_id":"81555b22-d2fc-4a48-a3fa-5f781b8050de","resolution":{"observed_at":"2026-08-07T15:43:10.723342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.310090Z","title":null,"venue":null,"work_id":"4116fe46-8210-4aac-87c1-c78504160ad8","year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.738047Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:662fc5f332c47898d6e7a0f53454fd9f2443c808ab207eb41080f8d9d7efa9c0","observation_id":"bfae39f8-0608-4960-a784-faa81715624f","resolution":{"observed_at":"2026-08-07T15:43:10.415022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.082569Z","title":null,"venue":null,"work_id":"5fb28888-63e5-4e09-8d8a-1a541cc904f9","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.815206Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d114f57e6abdf25ff9bfc0c616dee98c5d46b3a1c415246081cb3c23dc832642","observation_id":"297b779f-1dcb-42d1-b39f-67b71e41f16d","resolution":{"observed_at":"2026-08-07T15:43:10.172184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.892897Z","title":null,"venue":null,"work_id":"7f7b1cb5-5754-43b4-9779-7afa9c6274fc","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.975962Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7b0a6b840138cf716a209249f9de20e91579eaf0230f84bae4b532a0d31d6f0a","observation_id":"7a59dfef-6315-4d5a-a97f-4e80db70ed38","resolution":{"observed_at":"2026-08-07T15:43:10.001649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-07T15:43:02.080560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.080560Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:3b21ed77542ee5aaf0d36cbd14f58e9dd7a3745b3638e3ea58d53490ddf7205b","observation_id":"06e5e715-c608-4eeb-9469-b882820327ce","resolution":{"observed_at":"2026-08-07T15:43:02.080560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T15:43:02.211420Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.211420Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:ed9fc98839e52cd81aecc90535a14478c5655b418748ad8402acec88dc4974d3","observation_id":"4aec75c2-ff56-486d-9e56-21d437597555","resolution":{"observed_at":"2026-08-07T15:43:02.211420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.710282Z","title":null,"venue":null,"work_id":"e949dfd4-3572-421a-a02a-f7f15b674fe8","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.306012Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:8f48cec5c549605febf66e78a1ac9cbcadfbf1d434c201b4af253d121158779e","observation_id":"41a7cba7-f4ab-45f2-87d5-26d903950700","resolution":{"observed_at":"2026-08-07T15:43:09.796495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06408","last_updated":"2024-06-20T18:21:49Z","snapshot_observed_at":"2026-07-06T17:14:41.030939Z","submitted_at":"2024-01-12T07:10:10Z","title":"AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters","version":3},"cited_work":{"arxiv_id":"2401.06408","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06408","snapshot_observed_at":"2026-08-07T15:43:04.992448Z","title":"AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters","venue":"cs.CL","work_id":"fee61869-2d67-463f-af3b-513e75727b07","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.460556Z"},"links":{"cited_paper":"/paper/2401.06408","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:b7c0877715d31c86a46224910ec1ad14acd1e73e56dc897d12e37195c31678e9","observation_id":"6e26391d-6f50-4aec-9764-d2f88b2a4bde","resolution":{"observed_at":"2026-08-07T15:43:05.080971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-07T03:50:04.516601Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T15:43:02.614781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.614781Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d43caa8f6334b8d6e3e63735ee52b81b28a3bb55f9c18c3fe25ff94d56d64bd9","observation_id":"58768ad4-65f5-4480-8f5d-e1fd7c9863c9","resolution":{"observed_at":"2026-08-07T15:43:02.614781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.412492Z","title":null,"venue":null,"work_id":"7794aa13-3cf1-4aae-b69d-4e27a6c70624","year":2018},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.792246Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d7d8b83898ee1cefb680fca7764b210760514ca9a97f20dd2c80429c9026e15a","observation_id":"eb659bc0-9077-41b0-a310-5596479d0995","resolution":{"observed_at":"2026-08-07T15:43:09.530889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.214745Z","title":null,"venue":null,"work_id":"5b800efa-e34b-47e2-8e81-38ec631e993e","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.876964Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:6cf24b226308713bd819f63d222a3e8eb6bd03f45bc5c9ee8858bf7eddf93349","observation_id":"b915ff41-63fb-4189-bfd1-7b0f4c7748dd","resolution":{"observed_at":"2026-08-07T15:43:09.282711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.981170Z","title":null,"venue":null,"work_id":"34ce2e75-e95d-4649-ac0c-9ff8769bf068","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.004907Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:5bc7403b340e0e6cacdaaa62550fd0395871449448fc596914035a8eb2e4bab3","observation_id":"193edaf2-9d06-4bed-b305-31d943d7e611","resolution":{"observed_at":"2026-08-07T15:43:09.112489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.729370Z","title":null,"venue":null,"work_id":"91d80725-4b96-4d27-8fd3-a2438a2e95ad","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.085035Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:bd1d364c9a0044af84a09eacfd824759337a67cbc40cfe1a81218ec6e1005297","observation_id":"4e2c12da-88a6-441f-847b-bd1ecae9bc7d","resolution":{"observed_at":"2026-08-07T15:43:08.822452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.539745Z","title":null,"venue":null,"work_id":"8cd59fd1-e400-4790-8ff2-5a6c0fb28243","year":2010},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.150613Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:2df9969ddb43669570efeedbdc1ee64d75e8c3efd0b205b314e5573080141709","observation_id":"1c424ac0-1f8c-4648-be64-c83f4621142f","resolution":{"observed_at":"2026-08-07T15:43:08.634936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.300829Z","title":null,"venue":null,"work_id":"14059a5c-5cd6-46f3-9e7e-1dacd5adca37","year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.212731Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:0b1c8698b746b71fe3fe29c0667afbb99b4f360f4f2c961148700d1f2c527c3a","observation_id":"e122454f-aa2f-4508-bacf-0cbff24f8d7d","resolution":{"observed_at":"2026-08-07T15:43:08.436879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.068044Z","title":"T.; and Camacho-Collados, J","venue":null,"work_id":"9fcb4e83-93c1-49c4-95d8-095f9609b424","year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.347230Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:19ca1e61e891d3d6d7c67534259ee712083ae0f460e4a646e269a8261a996dd1","observation_id":"ccc02604-daa4-4771-9356-f4847f30df9a","resolution":{"observed_at":"2026-08-07T15:43:08.187236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T15:43:03.405489Z","title":"W.; Borgeaud, S.; Cai, T.; Millican, K.; Hoffmann, J.; Song, F.; Aslanides, J.; Henderson, S.; Ring, R.; Young, S.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.405489Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:36d113f7fd3069f15d097a47854506fbb0fcec2ba711ed709f6a7856d41ef004","observation_id":"a402d614-35df-4bc9-bd58-86badd34f09b","resolution":{"observed_at":"2026-08-07T15:43:03.405489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.850033Z","title":"A.; and Gordon, A","venue":null,"work_id":"e6140ff7-291b-4f6e-a54f-2375e4fffa94","year":2011},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.477574Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:382467d8d962e7605f62abfa6e53167e43aa9d4bbb91ed4f756972df7f997d76","observation_id":"5cdb4bc1-0741-4833-b90a-533655951ecd","resolution":{"observed_at":"2026-08-07T15:43:07.988963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T15:43:03.600455Z","title":"H.; Caverlee, J.; McAuley, J.; and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.600455Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:001feedc98ae0db1fad0b4155ddfd9c0e150ebffaae1231b61c4ee90be02141f","observation_id":"008d596f-f874-4fec-ae02-f2b8d97f73f7","resolution":{"observed_at":"2026-08-07T15:43:03.600455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.656708Z","title":"W.; Chowdhery, A.; Le, Q.; Chi, E.; Zhou, D.; et al","venue":null,"work_id":"92f3a7b4-8df5-4f3c-ae8f-a678bbfed073","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.767406Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:c6d791b88b14de2f188913dc209cce2a5c63be1412e4d92af4b3673f4e85c1cc","observation_id":"3e97874a-b70a-4fa2-9f89-bbf429272191","resolution":{"observed_at":"2026-08-07T15:43:07.764518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.414990Z","title":null,"venue":null,"work_id":"79ce490b-4be7-4013-b0a4-3159f341565f","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.879265Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:9417df0583f4ce916c9a0e2e393b33ff67871162526067d0b16f98dfba548c82","observation_id":"835b2ab2-bdc7-4468-a94a-5ff50653959f","resolution":{"observed_at":"2026-08-07T15:43:07.552561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:43:03.939326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.939326Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:a2c06677207824617fa927c975325859fa984ab2fab747e13e37f3814675aab6","observation_id":"6b002c33-edc9-45f8-98df-7a4127c0f0e1","resolution":{"observed_at":"2026-08-07T15:43:03.939326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.128457Z","title":null,"venue":null,"work_id":"9d3113de-1e98-4086-a986-2404c3c5b389","year":2018},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.028877Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d02647653dfde544add278b21dd1a13a0944dd5d14143f737ab8cf895bd30bd1","observation_id":"b6f99658-6016-4dcb-a565-fbf9526edc3e","resolution":{"observed_at":"2026-08-07T15:43:07.276440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-07T15:43:04.140161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.140161Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:904388d2e55db475b4f6a95d2534340913627a7fee6ef7ba4634e9abad03a761","observation_id":"f315cbc0-8d87-4f8f-81a5-ed74cc1a313f","resolution":{"observed_at":"2026-08-07T15:43:04.140161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T15:43:04.219551Z","title":"L.; Fan, A.; Akiki, C.; Pavlick, E.; Ili \\'c , S.; Hesslow, D.; Castagn \\'e , R.; Luccioni, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.219551Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:03233e0d8427af2805bd706c372d8075d7c854f30a678d0da23b6939236be948","observation_id":"e03e42be-eb94-4a0f-a1d5-07667bf31966","resolution":{"observed_at":"2026-08-07T15:43:04.219551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.881467Z","title":"M.; Pham, H.; Dong, X.; Du, N.; Liu, H.; Lu, Y.; Liang, P","venue":null,"work_id":"9dfde278-8a19-4196-bad0-0ca9a9d42ea0","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.308823Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:afa0c5518efdc179bc68c8ec0f52440190134f289d8a8fa6eb22ae300a895d30","observation_id":"f4c74935-0855-4bba-9761-8db48bea8eb6","resolution":{"observed_at":"2026-08-07T15:43:06.975386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.556380Z","title":"M.; Santurkar, S.; Ma, T.; and Liang, P","venue":null,"work_id":"25745013-a755-487c-84d3-42023e8ee20e","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.390396Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:9c5a95933ac5298adde11245d45c5fef95303bf216e1235dfe7860dda48fe9a2","observation_id":"bcbf2f87-91e2-4fee-9a76-472d9fc8aa1b","resolution":{"observed_at":"2026-08-07T15:43:06.714625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.255736Z","title":null,"venue":null,"work_id":"66c46f5a-c605-439b-a9a7-aa5edfa57979","year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.486167Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:fffe3cfdf37e14355ee9271e0ae042764e2ab92fd1f2c1148eeee34c4bce5d0b","observation_id":"a81412d3-804a-4897-92df-a78aca3ed892","resolution":{"observed_at":"2026-08-07T15:43:06.340398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07498","last_updated":"2021-09-29T17:09:40Z","snapshot_observed_at":"2026-08-01T14:47:10.324996Z","submitted_at":"2021-07-15T17:51:25Z","title":"FewCLUE: A Chinese Few-shot Learning Evaluation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07498","snapshot_observed_at":"2026-08-07T15:43:04.560146Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.560146Z"},"links":{"cited_paper":"/paper/2107.07498","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d459182403245b4a0dd1874ce441ac5a4d3dc6fc437003155c885b1c06f3808d","observation_id":"fe812265-7d11-49e3-b993-847d3e29acdc","resolution":{"observed_at":"2026-08-07T15:43:04.560146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.965351Z","title":null,"venue":null,"work_id":"3f2887f4-c22f-40c0-8ea5-87b7e8c53d1e","year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.679492Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:bff6d2bd3b26a7a8a78dccf74fdbc8e00406dac5769489baaec39b0d0011914c","observation_id":"78ce1f43-17ac-4733-ba13-0b68cccbce71","resolution":{"observed_at":"2026-08-07T15:43:06.050140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.560706Z","title":null,"venue":null,"work_id":"2d2cb762-4e35-4dc4-ab79-bff99105f5c4","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.846398Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7dbee4624bd40a77143913bcd877c96c3723c85598a49896804de4cd392bced8","observation_id":"76c4d10a-decb-43f7-8cd0-48954d9eb888","resolution":{"observed_at":"2026-08-07T15:43:05.690013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.14070."}