Pith. sign in

Paper Citation Record · LEDGER

CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2410.18505.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2410.18505 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 6 of 6 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T23:10:21.947143Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 622af388-ca6b-4f89-8b35-c2534e68f253 · inbound

OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training cites this paper.

OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T20:33:20.656765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T20:33:20.656765Z digest=sha256:37af8a31f282dae5803cf4912a62a5479869ff4ca3d1e48f3b3138cbcf778f2f

Observation 76594633-18f9-418d-8725-a96bce7f948f · inbound

Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data cites this paper.

Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T23:10:21.947143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:10:21.947143Z digest=sha256:a0be78b30ebee9e0eaba73214534ae66cf8c9c6cb35dffefe82040f94f352a22

Observation d1b4a90b-7513-416a-8aa0-e83149fe20fa · inbound

SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science cites this paper.

SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T20:21:14.749939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:21:14.749939Z digest=sha256:08f6b896bd971c242aa113a780595868bc44b3b98355b56dec630f1d7ba49de9

Observation edd32e32-ab94-458e-8851-249b94bef12e · inbound

MiniCPM4: Ultra-Efficient LLMs on End Devices cites this paper.

MiniCPM4: Ultra-Efficient LLMs on End Devices CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:31:21.709208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:31:21.709208Z digest=sha256:a5f27d4d3109837a7fce93283dce1516e6d2cb47f638b90f54763493062e61e8

Observation ad7a8d4d-4e1e-4226-9a4e-a9043b095146 · inbound

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph cites this paper.

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Reference 103

Resolution
verified exact
arxiv_id, observed 2026-06-30T06:14:18.494710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-30T06:04:40.684934Z digest=sha256:b06e1f8ced745e3481839010751fedfc37ca8b877718ff2b18b559d01d6cd194

Observation 95563692-4e35-4766-bb37-117e227deb47 · inbound

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics cites this paper.

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-12T19:39:56.205258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T19:39:56.205258Z digest=sha256:b639eecae70f88df96ecbff42a314d92fd7c7533a3e2e5fecfb9d231ee8bd97c