{"as_of":"2026-08-13T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05f218fb689e2664a5fa69554f80cfa36724a0791b00e2ed6a355221e6eb1fe9","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:45:47.456648Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11289/citation-record","integrity":"/paper/2411.11289/integrity","json":"/paper/2411.11289/citation-record.json","paper":"/paper/2411.11289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.275930Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.275930Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:9d0c6f094af4ef98d8b66f1970a86501854f2f7772c66105855abcd6d543f586","observation_id":"e505cc8e-abb1-461d-a3f9-9e173c33a16a","resolution":{"observed_at":"2026-08-12T18:45:47.275930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.281045Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.281045Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:ff269fca7af1ac9fa92d1012cf9c27bcedb13938759d4818122cbca7cb9275e4","observation_id":"a5877f6c-8252-4ead-a9cf-37c6047e80cf","resolution":{"observed_at":"2026-08-12T18:45:47.281045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:48.001064Z","title":null,"venue":null,"work_id":"de7e7523-9111-4892-bf51-350b1a2d5d02","year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.285258Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:f411c1d8665bb8a5696b49d4017c7164b0eff4cc0158002080493a06820c3781","observation_id":"a88e7e4e-3016-4037-b503-f83531d6c160","resolution":{"observed_at":"2026-08-12T18:45:48.004599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.990144Z","title":null,"venue":null,"work_id":"9851e4a3-ee0f-4a99-93fb-dccb54f9217d","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.289270Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:52cbad37a6dfcf7e6577b7736349600a8ce36421b28e42231ca25ee73dda9aab","observation_id":"49244de8-3e6e-493f-bb21-2d486fef0b19","resolution":{"observed_at":"2026-08-12T18:45:47.993728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.979359Z","title":null,"venue":null,"work_id":"46b4102a-aa44-4835-862f-a952f47d83b7","year":2018},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.293373Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:625a5cc87f36415885d842cc32348ce3b6b9909e9356165b1a63f1de87d96368","observation_id":"4a628319-8cf8-44c8-bd8a-b33e7edf056c","resolution":{"observed_at":"2026-08-12T18:45:47.983224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.297558Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.297558Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:4b1f7edd2c9e3c08890240a873e5566fc96541996f70c7f9ba99f315464e66db","observation_id":"c4d78c37-cda5-4eff-9b41-cb463bd6fb13","resolution":{"observed_at":"2026-08-12T18:45:47.297558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.962429Z","title":null,"venue":null,"work_id":"4abbaf04-4841-4fed-9d9a-c5e675812a05","year":2021},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.301614Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:4ef4a76fd93502c88f78f44b6fa17293c20388fdb337bf4acca7406c3f14ea18","observation_id":"71be09d8-9059-4f0c-8cce-b89197e44551","resolution":{"observed_at":"2026-08-12T18:45:47.966152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09530","last_updated":"2024-07-25T03:08:18Z","snapshot_observed_at":"2026-08-13T10:11:07.103614Z","submitted_at":"2023-09-18T07:17:52Z","title":"Adapting Large Language Models to Domains via Reading Comprehension","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09530","snapshot_observed_at":"2026-08-12T18:45:47.305514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.305514Z"},"links":{"cited_paper":"/paper/2309.09530","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:1f2c94eb456e3e71312ad080812fd201ca43e807c1671bc6bf94f86c37264d22","observation_id":"5647e516-a565-4874-8267-3ee41f1a8693","resolution":{"observed_at":"2026-08-12T18:45:47.305514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06599","last_updated":"2020-05-13T21:41:29Z","snapshot_observed_at":"2026-07-06T09:20:09.390875Z","submitted_at":"2020-05-13T21:41:29Z","title":"Phishing URL Detection Through Top-level Domain Analysis: A Descriptive Approach","version":1},"cited_work":{"arxiv_id":"2005.06599","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.06599","snapshot_observed_at":"2026-08-12T18:45:47.862909Z","title":"Phishing URL Detection Through Top-level Domain Analysis: A Descriptive Approach","venue":"cs.CR","work_id":"26e96cb7-678f-42fd-ae07-f95a5fb2bf48","year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.309948Z"},"links":{"cited_paper":"/paper/2005.06599","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:54cd5766e0e1f8fc0cb7b29421fd395b5b41b55ccc3a8ce334243a86816d5f07","observation_id":"27e35cb7-e3fb-4721-beb4-3a92ec083588","resolution":{"observed_at":"2026-08-12T18:45:47.866879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00075","last_updated":"2019-04-30T19:43:53Z","snapshot_observed_at":"2026-08-11T21:10:28.392655Z","submitted_at":"2019-04-30T19:43:53Z","title":"On the Use of ArXiv as a Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00075","snapshot_observed_at":"2026-08-12T18:45:47.314293Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.314293Z"},"links":{"cited_paper":"/paper/1905.00075","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:79f3ea5b997cfc00c75eb76c23d9e564479936769b454e2ccfcc663210646079","observation_id":"1d069b1b-f0c9-495a-8c1c-f34ab889b51f","resolution":{"observed_at":"2026-08-12T18:45:47.314293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.951063Z","title":null,"venue":null,"work_id":"f4110043-9655-4c9c-b071-f822de68303e","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.318395Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:3e30de8b9becb73cb27d91a9e442a14e216896b450f21cfd638e750822ec586d","observation_id":"73a62454-40bf-4f5f-af00-0fe41e54a12f","resolution":{"observed_at":"2026-08-12T18:45:47.955064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.322374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.322374Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:b6296e692c12b2951e1883902499d0a4f9e65ae28d333deace59a436fdbc0458","observation_id":"7e26c37d-631e-4a13-8e85-00606b53cbd5","resolution":{"observed_at":"2026-08-12T18:45:47.322374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-11T11:33:47.725577Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-12T18:45:47.325992Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.325992Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:27ba21b1b92ea8e0d0fb7602e87616fa1000ee8aa38ac0896c5de910305ee000","observation_id":"259781e1-1179-4b19-9d5b-72610e974917","resolution":{"observed_at":"2026-08-12T18:45:47.325992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11540","last_updated":"2025-02-28T14:35:58Z","snapshot_observed_at":"2026-08-12T22:22:48.348205Z","submitted_at":"2024-10-15T12:14:57Z","title":"Data Quality Control in Federated Instruction-tuning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11540","snapshot_observed_at":"2026-08-12T18:45:47.330011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.330011Z"},"links":{"cited_paper":"/paper/2410.11540","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:4b9b0f9815d131db31a30d5554d4a5fadb60a7f3aac8b165ade5e0a217884362","observation_id":"a6ae8fc1-d58a-4850-982d-360f3ee55ee6","resolution":{"observed_at":"2026-08-12T18:45:47.330011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:45:47.334094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.334094Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:eeb740f334f926699f9e096a71af29d0e1077159dbc483470a3a20649507a6e8","observation_id":"6f540b78-7172-4ca0-ba3b-5906990ecb16","resolution":{"observed_at":"2026-08-12T18:45:47.334094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.934188Z","title":null,"venue":null,"work_id":"91877de3-da4d-4e89-a673-6d0a2160d6dd","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.337887Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:31f13e1a8bb5547456559b476d487f9ff21f74a7a97a88585242919f24e91474","observation_id":"0b0540e2-641a-45b1-baed-c59bcd8b7d58","resolution":{"observed_at":"2026-08-12T18:45:47.937576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-12T18:45:47.340919Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.340919Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:ddacf2047989067a6775a83b062232373f34fe496dd2f5abc27f8e9111c9846e","observation_id":"56830293-ee0c-42cb-8170-52d29974fe33","resolution":{"observed_at":"2026-08-12T18:45:47.340919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-12T18:45:47.344463Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.344463Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:13215e981cc90e111c5f7d7918e6c0e815e98c8bdcb19db6c0bf81f5e8e642ce","observation_id":"3db9891d-f6de-43e7-88d7-82bba16f8de5","resolution":{"observed_at":"2026-08-12T18:45:47.344463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05694","last_updated":"2025-01-27T03:50:31Z","snapshot_observed_at":"2026-08-13T05:53:55.378073Z","submitted_at":"2023-10-09T13:15:23Z","title":"A Survey of Large Language Models for Healthcare: from Data, Technology, and Applications to Accountability and Ethics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05694","snapshot_observed_at":"2026-08-12T18:45:47.348202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.348202Z"},"links":{"cited_paper":"/paper/2310.05694","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:53d445e6ef51dc5a6ebaee38c18ae8a618ff7767a45f4656909104dcefe5640a","observation_id":"f8f45303-ff9b-4ae4-9439-d3f80663947c","resolution":{"observed_at":"2026-08-12T18:45:47.348202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.352002Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.352002Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:69a8b5cf241aa06bfa0f06791433ca4551dfccdadec5a6f8f15b9f4c3156e102","observation_id":"e7fbd059-4ac2-467e-be30-3a8de261fbfa","resolution":{"observed_at":"2026-08-12T18:45:47.352002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12053","last_updated":"2024-04-02T06:04:16Z","snapshot_observed_at":"2026-08-13T10:08:24.364744Z","submitted_at":"2023-09-21T13:20:13Z","title":"AceGPT, Localizing Large Language Models in Arabic","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12053","snapshot_observed_at":"2026-08-12T18:45:47.355694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.355694Z"},"links":{"cited_paper":"/paper/2309.12053","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:a338dd562aa4980ee7a7561974c0509597887b19be527022d53b2b88d0b62f3e","observation_id":"0f623f01-33f5-4707-8538-7b3077cb2f5f","resolution":{"observed_at":"2026-08-12T18:45:47.355694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.359225Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.359225Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:e73ec06e7577193ea30c7b5cd87a605efcec5e1a7809389270f218474c634893","observation_id":"d6e6250e-023d-4d6d-a103-021db00e6a67","resolution":{"observed_at":"2026-08-12T18:45:47.359225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-07-06T05:02:39.487370Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-12T18:45:47.362493Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.362493Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:a9cb7fa13deabd6ff7b0051f8b99845fa837dd8ad958c5811bf603f2da18ab22","observation_id":"e306c955-246b-4b5b-b0f2-d0ebd66141ae","resolution":{"observed_at":"2026-08-12T18:45:47.362493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.366251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.366251Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:712b1357c73c51fe1236a7b3010bbf52c869400791acbacff3b0bad7137505ac","observation_id":"c493f4d8-994e-4771-8471-d6d58d7eed69","resolution":{"observed_at":"2026-08-12T18:45:47.366251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04795","last_updated":"2024-10-08T04:05:18Z","snapshot_observed_at":"2026-08-12T22:29:27.074300Z","submitted_at":"2024-10-07T07:14:37Z","title":"Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.04795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04795","snapshot_observed_at":"2026-08-12T18:45:47.701097Z","title":"Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models","venue":"cs.CL","work_id":"9e4883da-1460-44f6-8a04-d7145340b174","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.369787Z"},"links":{"cited_paper":"/paper/2410.04795","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:2385fe8d1228b7041d22d02b55b2925cbc18d19d2fe34962da8c2dbab0a3ef20","observation_id":"67c03c44-4ea8-49cf-b150-d5e53cc813e5","resolution":{"observed_at":"2026-08-12T18:45:47.705456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09613","last_updated":"2024-09-15T05:27:56Z","snapshot_observed_at":"2026-08-12T22:44:45.896698Z","submitted_at":"2024-09-15T05:27:56Z","title":"Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora","version":1},"cited_work":{"arxiv_id":"2409.09613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09613","snapshot_observed_at":"2026-08-12T18:45:47.685317Z","title":"Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora","venue":"cs.CL","work_id":"b1daf073-65b6-4fde-ac5c-ab154a6e6130","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.373671Z"},"links":{"cited_paper":"/paper/2409.09613","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:7dbd1e4d16530a92125e5166214d3f9c5325ba51b570e14391aa4203fd0a1fc3","observation_id":"fcccf092-180c-4eb0-94de-4d42536a4822","resolution":{"observed_at":"2026-08-12T18:45:47.689752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.377494Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.377494Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:526f8870486746c2501a18aca8b55eebae597986264e49d1dc6b2c3954d7f7df","observation_id":"14047864-7f4e-4151-9a07-5b9d27dae966","resolution":{"observed_at":"2026-08-12T18:45:47.377494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02315","last_updated":"2024-02-04T02:06:57Z","snapshot_observed_at":"2026-08-13T04:27:34.843625Z","submitted_at":"2024-02-04T02:06:57Z","title":"A Survey of Large Language Models in Finance (FinLLMs)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02315","snapshot_observed_at":"2026-08-12T18:45:47.380962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.380962Z"},"links":{"cited_paper":"/paper/2402.02315","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:a9aa87d628ac4611206f3edbfbe51a7f386df85a8ad165caa69e678581d94881","observation_id":"2e0b4a27-b7c8-4664-8681-5df646ce620a","resolution":{"observed_at":"2026-08-12T18:45:47.380962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08310","last_updated":"2024-08-15T17:59:30Z","snapshot_observed_at":"2026-08-12T23:02:59.660640Z","submitted_at":"2024-08-15T17:59:30Z","title":"ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08310","snapshot_observed_at":"2026-08-12T18:45:47.384702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.384702Z"},"links":{"cited_paper":"/paper/2408.08310","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:a27441ba3891f551de4aaa4ecf2cdf8623031d09305f6c64953f46fcf54fe6a8","observation_id":"4c72d3dd-a3df-4e6a-b461-9f0e09781dfe","resolution":{"observed_at":"2026-08-12T18:45:47.384702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-12T18:45:47.388685Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.388685Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:6a0e53149872dd1af93f9a100cb2db6d31ab8ff6aad14f9f5573a270badafc5f","observation_id":"af398f6b-33f5-4362-92d1-3dc7512643f2","resolution":{"observed_at":"2026-08-12T18:45:47.388685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18703","last_updated":"2024-03-29T14:05:07Z","snapshot_observed_at":"2026-08-13T11:29:52.204008Z","submitted_at":"2023-05-30T03:00:30Z","title":"Domain Specialization as the Key to Make Large Language Models Disruptive: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18703","snapshot_observed_at":"2026-08-12T18:45:47.392578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.392578Z"},"links":{"cited_paper":"/paper/2305.18703","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:08aa446a021a3bc8131aaaf47bf05cb557f3f255c2ca90ce1c9845e602e74813","observation_id":"4ccd94f2-71d0-40b4-9a6c-c400eed6ac19","resolution":{"observed_at":"2026-08-12T18:45:47.392578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-13T04:08:35.663182Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-12T18:45:47.396379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.396379Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:0466c0220997488417080e7eed4280481a3c42fbc6bfade9b5885ee87e4efbfb","observation_id":"37096026-1430-4e0c-8202-edc335fd51ae","resolution":{"observed_at":"2026-08-12T18:45:47.396379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-08-13T11:37:07.444877Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-12T18:45:47.400107Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.400107Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:75e0f98623fe04356a926da3c1c6d4b5c54587fdfb52b909a726ed3a31883170","observation_id":"52887b6f-242a-42ba-a6a8-527b283ffe2f","resolution":{"observed_at":"2026-08-12T18:45:47.400107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.904364Z","title":null,"venue":null,"work_id":"ab84c2d8-c40e-4e84-9b4f-d967bad5e210","year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.404147Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:fa8b85c105c133c19a815c30c6b4a978c89f0f732827eaa2c3c7ab69e8d3673d","observation_id":"a0afc553-5248-47f1-8675-99c78764db6e","resolution":{"observed_at":"2026-08-12T18:45:47.907757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-12T18:45:47.408142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.408142Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:efd99ddfc159907d47247fdefb7f6df8e71a4966ca10a2e83a6f9c61f3b50769","observation_id":"4a0dba26-7c89-486b-91b2-1df0765b4655","resolution":{"observed_at":"2026-08-12T18:45:47.408142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.411968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.411968Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:2e01497fd297903b259d5183be38ca1a77cc187ed9ee2efca574d07a5c795042","observation_id":"db0e676f-f173-4203-8376-45b5f9a53136","resolution":{"observed_at":"2026-08-12T18:45:47.411968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04925","last_updated":"2024-04-07T11:52:44Z","snapshot_observed_at":"2026-08-13T00:35:36.874116Z","submitted_at":"2024-04-07T11:52:44Z","title":"Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04925","snapshot_observed_at":"2026-08-12T18:45:47.415474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.415474Z"},"links":{"cited_paper":"/paper/2404.04925","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:d37070212bccfd4863e99776a76705d8111674cfb8efc67f0b74a8a068c9862d","observation_id":"c4a4a7a2-4d5d-4754-a317-017caa9419c0","resolution":{"observed_at":"2026-08-12T18:45:47.415474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-12T18:45:47.418939Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.418939Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:38aa23b37daf227290fcb73cf115ad3f3b059f181171d4d810b0952eec983185","observation_id":"8a99f2ae-5b13-4e08-90b5-ef4151953a8b","resolution":{"observed_at":"2026-08-12T18:45:47.418939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.422041Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.422041Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:d2e5ac6f8a58f9df8dbbb5e08a3f9b2884faa708b40de1bdb06a0e2124216203","observation_id":"115cdbb7-6edb-4bc4-9cf9-7979d9badd47","resolution":{"observed_at":"2026-08-12T18:45:47.422041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13086","last_updated":"2024-01-23T20:55:49Z","snapshot_observed_at":"2026-08-13T04:35:58.770389Z","submitted_at":"2024-01-23T20:55:49Z","title":"Towards Trustable Language Models: Investigating Information Quality of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13086","snapshot_observed_at":"2026-08-12T18:45:47.424969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.424969Z"},"links":{"cited_paper":"/paper/2401.13086","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:b3ab55cdc45a9b9d9edf7566d59dee1bb5bc245ca8a9c508abbe3248699613e5","observation_id":"ba007ee1-7879-4889-8ecc-81f8c819e6ee","resolution":{"observed_at":"2026-08-12T18:45:47.424969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-13T04:18:39.535968Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-12T18:45:47.427739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.427739Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:44d1027c4e54a0c5d2cb579fe16e96dba748b77cb05dcf69a2a897d0bd29a12a","observation_id":"c3d4efd7-58b9-4bca-be02-88d5c24569b8","resolution":{"observed_at":"2026-08-12T18:45:47.427739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-13T10:09:46.005593Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-12T18:45:47.431927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.431927Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:4ec15ea97ba8170475acaf74c84f57a5bbc82815c1c65f2da469787dc27f1d51","observation_id":"8d292b3c-475e-4d4a-95d0-54bfb8352ec4","resolution":{"observed_at":"2026-08-12T18:45:47.431927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.435174Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.435174Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:e3e19d04ee4266a388bc3ffe72c2f161e620a633e87eb1fe191494c0dc644d81","observation_id":"ace21aff-d788-466c-b759-b0916ab20317","resolution":{"observed_at":"2026-08-12T18:45:47.435174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05558","last_updated":"2022-07-27T17:26:18Z","snapshot_observed_at":"2026-08-09T15:45:49.951754Z","submitted_at":"2020-07-10T18:26:17Z","title":"The Computational Limits of Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05558","snapshot_observed_at":"2026-08-12T18:45:47.438429Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.438429Z"},"links":{"cited_paper":"/paper/2007.05558","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:40a1c331e059d27b2948813e5c00e5a50c3776aa8a6aa6bf3d054b0c7f553ad1","observation_id":"3cab4dd2-992a-49d9-9ce9-52b24aa345f8","resolution":{"observed_at":"2026-08-12T18:45:47.438429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07922","last_updated":"2024-07-16T06:37:43Z","snapshot_observed_at":"2026-08-13T00:32:28.682285Z","submitted_at":"2024-04-11T17:09:28Z","title":"LaVy: Vietnamese Multimodal Large Language Model","version":6},"cited_work":{"arxiv_id":"2404.07922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07922","snapshot_observed_at":"2026-08-12T18:45:47.534154Z","title":"LaVy: Vietnamese Multimodal Large Language Model","venue":"cs.CL","work_id":"7c1f0cc0-ddd7-4f40-8d10-e8c9a0685159","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.441989Z"},"links":{"cited_paper":"/paper/2404.07922","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:23ded8d9b7025709aed29ffe566e5cbc9fb5746171281ffce095b2f7cce27880","observation_id":"e22af3df-990c-46e8-853a-605afbf5b485","resolution":{"observed_at":"2026-08-12T18:45:47.539891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-12T18:45:47.445614Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.445614Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:e81f29603967ad449c3d91c6a22e244339952d5a2f654dcbc8484b05a0b5e036","observation_id":"056c7337-fd3a-4750-b319-ba5022c4b0e8","resolution":{"observed_at":"2026-08-12T18:45:47.445614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T18:45:47.449325Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.449325Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:4c17f598ac9353e3c06ac2ddeac9e009d8f462da31b9b7dbae0711bf16da3fe2","observation_id":"7484a543-0137-4b88-b206-5367299cfeff","resolution":{"observed_at":"2026-08-12T18:45:47.449325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18815","last_updated":"2024-11-10T12:49:15Z","snapshot_observed_at":"2026-08-13T04:07:44.302654Z","submitted_at":"2024-02-29T02:55:26Z","title":"How do Large Language Models Handle Multilingualism?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18815","snapshot_observed_at":"2026-08-12T18:45:47.452845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.452845Z"},"links":{"cited_paper":"/paper/2402.18815","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:089303d21d3577a82655bb40431a709170b00b9a03349632613a81beff942754","observation_id":"bbcbf633-7451-4458-907c-cdfd33e8a7aa","resolution":{"observed_at":"2026-08-12T18:45:47.452845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-08-13T10:08:28.290453Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-12T18:45:47.456648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.456648Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:ff0d3d5bb7f3ee3bf33dbd046af8d34000a2cc7e36ea563d9d09ee5eed65af9e","observation_id":"6f51b415-8845-43ba-bc12-264b5b970d3e","resolution":{"observed_at":"2026-08-12T18:45:47.456648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T17:46:22.694558Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2411.11289."}