{"as_of":"2026-08-09T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:813fbb99956e3aec3466666791a7a4b983cb0e34de9140bfb8aee2edef63317e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:43.774684Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T04:32:34.075914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2502.02970","last_updated":"2026-04-02T13:28:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T08:11:23Z","title":"Distributional Statistics Restore Training Data Auditability in One-step Distilled Diffusion Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:27:59.317818Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2502.02970"},"observation_digest":"sha256:f786910a7e44809ca6c7ab4fb9fa3ae9757a0841a04d43a8bc15d3d37d57676f","observation_id":"0f976c4b-981b-4d12-80a9-d981826a6eb3","resolution":{"observed_at":"2026-05-23T04:32:34.080255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T15:27:43.774684Z","title":"Datasets for large language models: A comprehensive survey.arXiv preprint arXiv:2402.18041, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15859","last_updated":"2025-05-21T04:32:35Z","snapshot_observed_at":"2026-08-09T10:36:06.755867Z","submitted_at":"2025-05-21T04:32:35Z","title":"AutoData: A Multi-Agent System for Open Web Data Collection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:43.774684Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2505.15859"},"observation_digest":"sha256:dde6f25a1f891340d217313386ac056a866d1517209de8d73348b4be933b3a24","observation_id":"fb1b238b-7c38-4c83-a1be-ad3ad378718b","resolution":{"observed_at":"2026-08-07T15:27:43.774684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T12:25:31.066357Z","title":"Datasets for large language models: A comprehensive survey.arXiv preprint arXiv:2402.18041, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24539","last_updated":"2026-07-28T16:02:36Z","snapshot_observed_at":"2026-08-07T14:30:36.260777Z","submitted_at":"2025-05-30T12:46:44Z","title":"Localizing Persona Representations in LLMs","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:31.066357Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2505.24539"},"observation_digest":"sha256:ded43fa69b1024f64b2fba5cc8b8175a746804c6df300c1e35855527879054c1","observation_id":"cb92fe2c-4ac6-40ad-bdab-9b7a0f4eabff","resolution":{"observed_at":"2026-08-07T12:25:31.066357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T12:11:04.838038Z","title":"Datasets for large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00309","last_updated":"2025-06-28T05:54:45Z","snapshot_observed_at":"2026-08-09T10:36:52.271268Z","submitted_at":"2025-05-30T23:37:37Z","title":"Evaluation of LLMs for mathematical problem solving","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:04.838038Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.00309"},"observation_digest":"sha256:9e2979d9b345a2210a58372fdada96d6172b2d02712592eb17c69c7963065a78","observation_id":"d0fe05dd-d75b-4337-905d-ca5461442db7","resolution":{"observed_at":"2026-08-07T12:11:04.838038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T05:33:55.977344Z","title":"Datasets for Large Language Models: A Comprehensive Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07647","last_updated":"2025-06-09T11:12:02Z","snapshot_observed_at":"2026-08-09T11:40:16.573138Z","submitted_at":"2025-06-09T11:12:02Z","title":"Foundation Model Empowered Synesthesia of Machines (SoM): AI-native Intelligent Multi-Modal Sensing-Communication Integration","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:55.977344Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.07647"},"observation_digest":"sha256:46c013f69bf823211ee12d77fee5620b4d780b8ed5694d1df953afb5be948b2d","observation_id":"375a210b-b22c-46b5-8869-9ae8426d6592","resolution":{"observed_at":"2026-08-07T05:33:55.977344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T04:55:42.760418Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09433","last_updated":"2025-06-11T06:30:28Z","snapshot_observed_at":"2026-08-09T05:55:16.389343Z","submitted_at":"2025-06-11T06:30:28Z","title":"Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:55:42.760418Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.09433"},"observation_digest":"sha256:5c6b52798d367b1668ee22a01ddbc0ae94a4582be3993121d893d9d7623ac64d","observation_id":"67619092-df70-44c0-b895-3063f98c542f","resolution":{"observed_at":"2026-08-07T04:55:42.760418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T23:25:49.043762Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:49.043762Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:b5fdbecf3bb341e7870375b577867131be92fe54e0ea34b7eb7b6375dcdfe1a7","observation_id":"77577b03-da1b-45f3-806a-ebeccf02e3a6","resolution":{"observed_at":"2026-08-06T23:25:49.043762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T23:21:49.646197Z","title":"Datasets for large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18424","last_updated":"2025-06-23T09:03:58Z","snapshot_observed_at":"2026-08-09T10:36:00.397343Z","submitted_at":"2025-06-23T09:03:58Z","title":"A Large Language Model-based Multi-Agent Framework for Analog Circuits' Sizing Relationships Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:21:49.646197Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.18424"},"observation_digest":"sha256:344ecf40af1ad1821e46fdf4fd1bb2d160d575114197ad328c1b285d12f7d1e3","observation_id":"b0584a03-dbc9-4e19-8ecd-92da544a51d2","resolution":{"observed_at":"2026-08-06T23:21:49.646197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T21:36:39.625714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-06T21:29:49.550137Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":229,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:39.625714Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:2674e5b1fb366d85e831dc3487d040a445996c2966f4cd53790e615bb7797c37","observation_id":"23baa925-f007-469d-8a7b-8759085cd13c","resolution":{"observed_at":"2026-08-06T21:36:39.625714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T19:25:23.494844Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05716","last_updated":"2025-07-08T06:59:58Z","snapshot_observed_at":"2026-08-06T19:17:24.335490Z","submitted_at":"2025-07-08T06:59:58Z","title":"Divergent Realities: A Comparative Analysis of Human Expert vs. Artificial Intelligence Based Generation and Evaluation of Treatment Plans in Dermatology","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:23.494844Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2507.05716"},"observation_digest":"sha256:04d3305b0aa20a1d2c64138b4bc915cd667991abfaa36e227252acd73a5d129c","observation_id":"26501f17-f403-4565-861e-e1f530ac2be2","resolution":{"observed_at":"2026-08-06T19:25:23.494844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T15:15:20.243366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16414","last_updated":"2025-07-22T10:05:30Z","snapshot_observed_at":"2026-08-08T15:54:04.046664Z","submitted_at":"2025-07-22T10:05:30Z","title":"Identifying Pre-training Data in LLMs: A Neuron Activation-Based Detection Framework","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:15:20.243366Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2507.16414"},"observation_digest":"sha256:336b72167241f9f206ffd29db516546be043042d8cecd8449f104123d6c98d93","observation_id":"ad3912c7-80c3-47f6-90b1-1d3898063494","resolution":{"observed_at":"2026-08-06T15:15:20.243366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-04T05:55:44.707849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05637","last_updated":"2026-08-03T15:19:02Z","snapshot_observed_at":"2026-08-07T17:01:33.563160Z","submitted_at":"2026-03-05T19:47:26Z","title":"Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T05:55:44.707849Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2603.05637"},"observation_digest":"sha256:4c0a369a9dd074efbd2e5fac9a6cae1a501c7fc9a74adb447bd558b4a54e2ab3","observation_id":"33ce7cc0-72a5-41a7-867e-2bc3bb6b47e1","resolution":{"observed_at":"2026-08-04T05:55:44.707849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2604.19438","last_updated":"2026-04-21T13:12:42Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T13:12:42Z","title":"Malicious ML Model Detection by Learning Dynamic Behaviors","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:55.161515Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2604.19438"},"observation_digest":"sha256:30bcb94f8cc0d7b5c2cd7ddc562c942ec398cb08b692c07aecf247fb564e0e87","observation_id":"b393873d-4cd6-40de-a4b4-4de49dc2909b","resolution":{"observed_at":"2026-05-11T12:51:03.363201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2604.24544","last_updated":"2026-04-27T14:39:41Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:39:41Z","title":"STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:30.528601Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2604.24544"},"observation_digest":"sha256:df5425a9739451baac4b730f135c33e6624f51b52382efb921cd93432bd44173","observation_id":"bdea102a-4aa4-4a5e-acf9-e1b399d8214e","resolution":{"observed_at":"2026-05-11T22:01:10.987371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:01c7212855c32c3b365b5f5110eb5f3a3014b4ebe7c18bd3d3da08650cab560e","observation_id":"86d40402-f96a-48bd-abc2-34c39d8544e4","resolution":{"observed_at":"2026-05-11T17:26:04.548339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2605.06423","last_updated":"2026-05-07T15:29:10Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:29:10Z","title":"Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T09:14:12.034025Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2605.06423"},"observation_digest":"sha256:8e125ee52830fdada90b580a5c6ae855e3899cbea4a112ecaac03e34d03daa05","observation_id":"08d6aad8-1c08-43e9-a6c2-f493cdb13f70","resolution":{"observed_at":"2026-05-11T20:26:09.080186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-01T07:28:29.454905Z","title":"arXiv preprint arXiv:2402.18041 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:29.454905Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:013779694173019f7489420d9dee5692f2919ec1d510c5fbbc2d3480e95fa743","observation_id":"e248ba49-07ae-47db-b062-3552b36a2e01","resolution":{"observed_at":"2026-08-01T07:28:29.454905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T00:40:13.871444Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00932","last_updated":"2026-08-02T02:17:10Z","snapshot_observed_at":"2026-08-07T03:44:17.791751Z","submitted_at":"2026-08-02T02:17:10Z","title":"Gaokerena: A Small Persian Medical Language Model Family","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:13.871444Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2608.00932"},"observation_digest":"sha256:eb2e49657cde5d2e0fa89b70dfdc3fafbaa6af343faa83a8bb14cd6ac74ff90c","observation_id":"f8b5e71b-1dc6-42ee-9796-81902c30e167","resolution":{"observed_at":"2026-08-06T00:40:13.871444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T14:54:47.881669Z","title":"Datasets for large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04854","last_updated":"2026-08-05T13:47:59Z","snapshot_observed_at":"2026-08-08T23:13:18.685740Z","submitted_at":"2026-08-05T13:47:59Z","title":"Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:47.881669Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2608.04854"},"observation_digest":"sha256:05d33727dda0074d52d7997210f76f125e3062c7c8a1a0322d4d1ed4a8623d5c","observation_id":"62a5a337-ebd3-4d5c-93d6-aabf8366a5b3","resolution":{"observed_at":"2026-08-06T14:54:47.881669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.18041/citation-record","integrity":"/paper/2402.18041/integrity","json":"/paper/2402.18041/citation-record.json","paper":"/paper/2402.18041"},"outbound":[],"paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T10:35:52.671780Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2402.18041."}