{"as_of":"2026-08-08T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28046f39f292be686ee5609cd73a34d0e2be11e07cc15c44d3f139a3769e15da","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:57.893420Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-07T00:42:57.893420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-07T00:33:59.206204Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.893420Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3a246be4b4c618e9e85632943dbb509c81e073c28dd128ee6dfa6a31964a1490","observation_id":"d6180338-c7c0-4590-8908-2a9abcfcff23","resolution":{"observed_at":"2026-08-07T00:42:57.893420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-06T18:34:03.468882Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-06T18:25:51.582642Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.468882Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:9c1ca5e559771d20d966ff3252367d5c264b018c2b36fe359c7735873ee71385","observation_id":"686c5cde-bfab-4615-81e1-9f26e7b14129","resolution":{"observed_at":"2026-08-06T18:34:03.468882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":"2501.08197","doi":"10.48550/arxiv.2501.08197","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2501.08197","venue":"ArXiv.org","work_id":"2a083233-9374-43b9-8044-b5abe5c2703c","year":2025},"citing_paper":{"arxiv_id":"2605.30580","last_updated":"2026-08-04T17:55:16Z","snapshot_observed_at":"2026-08-07T23:11:37.090408Z","submitted_at":"2026-05-28T21:15:24Z","title":"Speculative Decoding and the Curse of Multilinguality","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T07:15:35.673216Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2605.30580"},"observation_digest":"sha256:1682a62d9fbeb964f56c6340b556932f3d3a1d7335c4bf63e2901a5c359f2b63","observation_id":"e5127bb7-2320-4fb8-ad0c-eb7eac77e0c6","resolution":{"observed_at":"2026-06-29T07:23:13.180961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":"2501.08197","doi":"10.48550/arxiv.2501.08197","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2501.08197","venue":"ArXiv.org","work_id":"2a083233-9374-43b9-8044-b5abe5c2703c","year":2025},"citing_paper":{"arxiv_id":"2606.12950","last_updated":"2026-06-11T06:22:39Z","snapshot_observed_at":"2026-08-07T01:21:32.231176Z","submitted_at":"2026-06-11T06:22:39Z","title":"Maestro: Workload-Aware Cross-Cluster Scheduling for LLM-Based Multi-Agent Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T06:09:06.904885Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2606.12950"},"observation_digest":"sha256:21b3a4e825fd72e97c7bb246aa4271af67370a27372e941ab5faa316779375f3","observation_id":"ab6c9bea-e6cc-48d0-8928-d72dcd261db2","resolution":{"observed_at":"2026-07-03T16:08:37.101862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":"2501.08197","doi":"10.48550/arxiv.2501.08197","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2501.08197","venue":"ArXiv.org","work_id":"2a083233-9374-43b9-8044-b5abe5c2703c","year":2025},"citing_paper":{"arxiv_id":"2606.18056","last_updated":"2026-06-16T15:33:49Z","snapshot_observed_at":"2026-07-31T23:55:23.919727Z","submitted_at":"2026-06-16T15:33:49Z","title":"ConSA: Controllable Sparsity in Hybrid Attention via Learnable Allocation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T00:33:18.513616Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2606.18056"},"observation_digest":"sha256:c0989975d52564226316b76fa08850c216f7bf8004cdc6d28c5d360c9c8976ab","observation_id":"923645f8-decc-4409-8fd1-0c764f070ded","resolution":{"observed_at":"2026-06-27T00:40:18.530335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-02T13:43:29.456364Z","title":"Opencsg chinese corpus: A series of high-quality chinese datasets for llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20465","last_updated":"2026-05-19T02:23:53Z","snapshot_observed_at":"2026-08-08T01:36:19.591301Z","submitted_at":"2026-05-19T02:23:53Z","title":"DataPrep-Bench: Benchmarking LLMs as Training Data Preparators","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T13:43:29.456364Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2607.20465"},"observation_digest":"sha256:bc287e384616dd0f50e90bda21b1fd97d0f196de0cbb54184da9299c77d4978e","observation_id":"a1be480d-9b52-4913-8e55-650ef7ec0d5b","resolution":{"observed_at":"2026-08-02T13:43:29.456364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08197/citation-record","integrity":"/paper/2501.08197/integrity","json":"/paper/2501.08197/citation-record.json","paper":"/paper/2501.08197"},"outbound":[],"paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2501.08197."}