{"as_of":"2026-08-08T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f3ef57bcc32dfa07f16b1274bc8acd2a97c4fd6e28474ba9f49c09c7c3f3f61","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:41:14.636513Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07463/citation-record","integrity":"/paper/2506.07463/integrity","json":"/paper/2506.07463/citation-record.json","paper":"/paper/2506.07463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:15.058248Z","title":"Rethinking reflection in pre-training, 2025","venue":null,"work_id":"1b165d19-05cc-491c-8c16-f3709a195423","year":2025},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.508198Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:250570efbf911169d5ad373fc82b9d9658d5b06117092ca57cfd863be6a93c51","observation_id":"1bb2cb67-650b-4bc9-bbeb-2e6be8b0b00d","resolution":{"observed_at":"2026-08-07T05:41:15.061372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18058","last_updated":"2024-11-02T11:08:49Z","snapshot_observed_at":"2026-07-06T17:51:36.160539Z","submitted_at":"2024-03-26T19:24:18Z","title":"COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18058","snapshot_observed_at":"2026-08-07T05:41:14.511955Z","title":"Coig-cqia: Quality is all you need for chinese instruction fine-tuning.ArXiv, abs/2403.18058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.511955Z"},"links":{"cited_paper":"/paper/2403.18058","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:b313f17cb4631ee02e147255d7cd895c31768fdb48c62c99793d5d58831d3a3a","observation_id":"ea004250-d416-4924-ade8-c31ed815c17a","resolution":{"observed_at":"2026-08-07T05:41:14.511955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:15.049423Z","title":"Careful selection of knowledge to solve open book question answering","venue":null,"work_id":"a282b1be-ea1c-4add-9497-12203b503294","year":2019},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.515368Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:79a094cb48151e243585ca9534a0dbe374329472042a848f58586d2d8795f25d","observation_id":"761eba16-ca57-421d-bf7b-81fca97c88fa","resolution":{"observed_at":"2026-08-07T05:41:15.052572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:15.039243Z","title":"CCI-Data [Data set]","venue":null,"work_id":"4d8f487f-88a8-4497-8c1e-8f05ee00ead9","year":null},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.518445Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:532b97f85ff8e4ec695e151380f48844345ec4d4cc18ee13a1e9a728fb7da51a","observation_id":"5ffeffb1-d8a8-400a-bdcc-4bd59c1a7ac4","resolution":{"observed_at":"2026-08-07T05:41:15.042870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:15.029099Z","title":"CCI2-Data [Data set]","venue":null,"work_id":"abe07e7a-07af-41ab-9f7c-1056ff47a388","year":null},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.521642Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:a4420bab2f70f9ef1640e21e646b38f784cddbcb69ee32e37887d860a3a43e6a","observation_id":"0db9bfae-f766-41b9-963b-b303ddd72d8b","resolution":{"observed_at":"2026-08-07T05:41:15.032842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:15.019055Z","title":"WuDaoCorporaText [Data set]","venue":null,"work_id":"4f6fb24f-1bc7-44e1-a2cd-576c03e58114","year":null},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.524471Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:b67f9199cc620e9c92f8efd1d3577d8af311460fd238916aa4d6a6739f1ec103","observation_id":"821bc742-0f46-4d42-ab6c-093a5f3eb79b","resolution":{"observed_at":"2026-08-07T05:41:15.022976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.527577Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.527577Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:0f2fe4a2101956cdee5f009674a2b2133b9d27f0917b22501e991d7da21a2eda","observation_id":"a77e3deb-fb75-4756-be2c-09d6d7bc5a95","resolution":{"observed_at":"2026-08-07T05:41:14.527577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:15.004938Z","title":null,"venue":null,"work_id":"774bfa2c-6b8d-4025-b323-c11b91fa01f3","year":1997},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.530537Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:503a2cc01efdf6bde4825a5292813f448fdd76a6612bcd6f9bc66ac48930a0ce","observation_id":"c76ddd3f-3f49-4c0c-bd78-aa2c8867756a","resolution":{"observed_at":"2026-08-07T05:41:15.007881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.995394Z","title":"Data- juicer: A one-stop data processing system for large language models.Companion of the 2024 International Conference on Management of Data, 2023","venue":null,"work_id":"32b35bc0-021a-4a33-9378-898445d00187","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.533269Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:9a8f828077f5b23e09e6dd867da2e06545406c6305cf0ad61a0f278821f17d1f","observation_id":"eb896623-f4b0-4fca-92b1-f8139b77609c","resolution":{"observed_at":"2026-08-07T05:41:14.999494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.986726Z","title":"Chinesewebtext: Large-scale high-quality chinese web text extracted with effective evaluation model, 2023","venue":null,"work_id":"ef1fb936-fad8-4157-a098-7c1047b2886b","year":2023},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.536439Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:26da028469af36e86f72dc120a63cd8f7f24d18fb58de549a9f081e10a836e18","observation_id":"6016aaf2-4ce7-44a1-a002-f5a9d56d1b65","resolution":{"observed_at":"2026-08-07T05:41:14.990030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.539286Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.539286Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:e7fcedfe21522309cd847795027dc7571ff70213145b2b198e1cb544d49cbd52","observation_id":"1b0e76a6-13b4-4204-baec-7bb14c2f216c","resolution":{"observed_at":"2026-08-07T05:41:14.539286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-08-02T09:09:10.011185Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02116","snapshot_observed_at":"2026-08-07T05:41:14.542023Z","title":"Unsupervised cross-lingual representation learning at scale.ArXiv, abs/1911.02116, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.542023Z"},"links":{"cited_paper":"/paper/1911.02116","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:e29bc10a9971a747ad028050330fc4b6ecaa37f6bd51bced3dfd848597708451","observation_id":"2e138668-d626-46a3-9a64-3ba295c84ae2","resolution":{"observed_at":"2026-08-07T05:41:14.542023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.972494Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":"d390f435-bfcc-4e6e-9932-87c4d7820b0e","year":2025},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.545952Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:080a2c7401952d5e94f34857365916cd21e61d953cc28ab602a61c913ac1f816","observation_id":"0d71b92f-79bb-419f-ae51-fcffb048db63","resolution":{"observed_at":"2026-08-07T05:41:14.975953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.962155Z","title":"Lighteval: A lightweight framework for llm evaluation, 2023","venue":null,"work_id":"aaaeeed3-fef0-4e5f-b8a8-728fc6fab9d5","year":2023},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.549699Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:b264b1ef3488a0c039e89cbfe8254519ed86dc27cfae91eae4591c0bf1b4b4f8","observation_id":"61725105-411f-4f92-a3ee-38d037407545","resolution":{"observed_at":"2026-08-07T05:41:14.965967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T05:41:14.552614Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.552614Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:6320cb0274ff5270669706636172d22b66823e65b17917416fd6a6801c6ff295","observation_id":"491272bb-96a7-46ad-990d-94452d443c50","resolution":{"observed_at":"2026-08-07T05:41:14.552614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T05:41:14.555798Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.555798Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:2a11a659c4eaa36567932b5052a949e220567b4d6b527ceeb02a2fa5338698c8","observation_id":"eedb7d1d-8808-4cc4-afce-714e6be0fb58","resolution":{"observed_at":"2026-08-07T05:41:14.555798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.952410Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models, 2023","venue":null,"work_id":"0f7b27ef-4cd3-4ee9-bd9e-4d5e51381007","year":2023},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.559100Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:5dcc1d7149808993d41ddc0c9d6af6135932b394cbd0646bba5f8dc5eca3abb6","observation_id":"568e34bd-b5b9-4742-a8e1-d580cb3dea04","resolution":{"observed_at":"2026-08-07T05:41:14.956085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.562041Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.562041Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:40031c276c32b97b031564fb10c90ad9aa16752695d3aa3cb4745bc5b0e339bc","observation_id":"124c3a16-07df-4d3c-9311-ab3121e7cefe","resolution":{"observed_at":"2026-08-07T05:41:14.562041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.565274Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.565274Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:98960672e106c22e3fdd2e17a79bb97f83778df1c935074a32f4081f209c39eb","observation_id":"21ec9a21-6c4c-414c-a150-2e4b90653a8e","resolution":{"observed_at":"2026-08-07T05:41:14.565274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-07-06T05:02:39.487370Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-07T05:41:14.568240Z","title":"Bag of tricks for efficient text classification.arXiv preprint arXiv:1607.01759, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.568240Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:115aa7348e674df67cf6df2aa7ff939dda4d2a2f8756d530587a7ac6d4a5845e","observation_id":"8a95f47b-695d-4749-9c5a-66e148574b86","resolution":{"observed_at":"2026-08-07T05:41:14.568240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.571434Z","title":"Deduplicating training data makes language models better, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.571434Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:b7ddf2cc3b506557f2cc8aff03750e95d2971b6d86a154f03990729582a9a707","observation_id":"3d10ba18-7116-4154-add2-7ca26760cf8e","resolution":{"observed_at":"2026-08-07T05:41:14.571434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.927185Z","title":"Levesque, Ernest Davis, and Leora Morgenstern","venue":null,"work_id":"3ec0a867-3a13-4ebb-b8cb-c441e3825139","year":2012},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.574169Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:6fb8e1c9731fb86cbdfdf234e70c1d1835601e1afff508c5987bf68d8f343230","observation_id":"adeb30bd-1aff-4068-a773-356b85376e54","resolution":{"observed_at":"2026-08-07T05:41:14.930480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.918197Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese, 2024","venue":null,"work_id":"5b23668d-d930-420d-b2ca-0da5b2e366c7","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.577122Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:5212c3d59cab13a42984b5938893542ca485442d7034c1149ecfa468002cabda","observation_id":"f4787769-6224-46fb-bbf7-6ecd8ae82858","resolution":{"observed_at":"2026-08-07T05:41:14.921385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.909459Z","title":"Datacomp-lm: In search of the next generation of training sets for language models, 2024","venue":null,"work_id":"2f41ea27-62b1-49f4-bf07-b45073d5f1a0","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.579822Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:c8495eed10ff2b2836c0450559d60d3612104c2a5c6ff3994e96e5ccd21bfd9e","observation_id":"eecd1c91-24f1-4d04-af7c-e816aa38a308","resolution":{"observed_at":"2026-08-07T05:41:14.912583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.900215Z","title":"Openhermes 2.5-zh: A partial chinese translation of openhermes-2.5, 2024","venue":null,"work_id":"c1d9c916-f3cb-4ead-be8f-8b1b2f6f04b7","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.582561Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:a639604d0eaabf22d1e0eb48e50e46a5f04b405a28b62787cfd36c2f343b2a65","observation_id":"5a40faad-a015-4d50-b153-f5e2fc448e83","resolution":{"observed_at":"2026-08-07T05:41:14.903381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.891127Z","title":"Fineweb2: A sparkling update with 1000s of languages, December 2024","venue":null,"work_id":"fb013f7b-4061-40f6-b1ae-d7f7c94b849f","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.585479Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:b0952303024b6ce16a688715ce3a625f83c62a2b67db90b4e2152f973dbe1a52","observation_id":"f80f6c1e-32d9-412a-82e4-9f296db90657","resolution":{"observed_at":"2026-08-07T05:41:14.894325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-07T05:41:14.588446Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data, and web data only.arXiv preprint arXiv:2306.01116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.588446Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:5d7beb205f4831bd17c80c1f3c99462534e34b6c19856bfd856063e87cbebac4","observation_id":"170dd499-10b3-44f6-a796-c6a1bb4bd353","resolution":{"observed_at":"2026-08-07T05:41:14.588446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.881581Z","title":"Deduplicate Text Datasets","venue":null,"work_id":"a01866bf-6cf9-4422-bed6-bf30a78daf3e","year":2021},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.592064Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:0ad6743b591a7ce512338e0a0b1d2f12b04e19ec82a4379b1d66c5aef53aee28","observation_id":"ec09a55b-c1db-4934-9655-83e2df2b2ec1","resolution":{"observed_at":"2026-08-07T05:41:14.884898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.596279Z","title":"Socialiqa: Com- monsense reasoning about social interactions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.596279Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:9007cee1cfad03130a02f890dec7377a92ee7a0a13dd321d9d0141f85ec37400","observation_id":"0bee756a-db61-495c-b69a-e91352b8ca2b","resolution":{"observed_at":"2026-08-07T05:41:14.596279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-08T04:07:59.311599Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-07T05:41:14.600683Z","title":"Dolma: An open corpus of 3 trillion tokens for language model pretraining research.arXiv preprint arXiv:2402.00159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.600683Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:2989b7a5ee1a5d3ac798ee84492c597bcd72efced2e376eb09c1b7fc80a23c5b","observation_id":"edbe1d46-58dd-4497-939c-f4d2edd9d3f6","resolution":{"observed_at":"2026-08-07T05:41:14.600683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.785167Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2024","venue":null,"work_id":"9edf6b11-115b-4955-a5a6-e801ca2f5481","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.604175Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:3784d0553283f838ac7fab9da9739bb02917b79019e702f893664c35bf89dcc3","observation_id":"ae53137f-0530-4d27-a82b-da4d9d9ba88d","resolution":{"observed_at":"2026-08-07T05:41:14.788616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T05:41:14.610652Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.610652Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:110e933a5ebccc964905f5baafcf27286570d4b2c58604d4b7e55ecd3bf3b5b5","observation_id":"d4c02cd1-5746-45b0-9ac3-8b0cc7ddabc6","resolution":{"observed_at":"2026-08-07T05:41:14.610652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-07T05:41:14.613803Z","title":"Nemotron-4 340b technical report.arXiv preprint arXiv:2412.02595, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.613803Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:61d776d7666cb087910a022d7264521833168340babf1ee2096b4d6404a57573","observation_id":"5ff8f4b7-0c07-4cd2-83bb-0dc2b5b4905b","resolution":{"observed_at":"2026-08-07T05:41:14.613803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.616833Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.616833Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:30017cc215be5c0a2c3c222d07a3fa3ac6e0a9323e1f9f770488d5222f1aa18f","observation_id":"62abf318-fd8f-4daf-bd0b-cb4e3abf1b12","resolution":{"observed_at":"2026-08-07T05:41:14.616833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.769419Z","title":"Cci3.0-hq: a large-scale chinese dataset of high quality designed for pre-training large language models, 2024","venue":null,"work_id":"8603ce6b-5db3-410f-8156-8eee1ceb8f8b","year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.619787Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:c960b764998fb76d3553af9aca1eccd405311df0d97e45f277ccfaaad570fb99","observation_id":"bfb42c5d-8ef1-4ffb-a744-bcb6f04f7312","resolution":{"observed_at":"2026-08-07T05:41:14.773012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:41:14.622934Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.622934Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:a43c819641a3c287092deb209f615a1baef78d1bf8e689cfbd26eedba33d7078","observation_id":"ee8c4ba0-2457-4119-97b4-aa53e8736227","resolution":{"observed_at":"2026-08-07T05:41:14.622934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.759358Z","title":"Opencsg chinese corpus: A series of high-quality chinese datasets for llm training, 2025","venue":null,"work_id":"5255b89b-ca98-4a5c-aade-59402f294506","year":2025},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.626461Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:567e46886e17f277f37fd575e6a0ba299c9804e8c2de3267e4568f99f9f21e20","observation_id":"fec69a07-0e43-46e1-91ea-2e38f3306176","resolution":{"observed_at":"2026-08-07T05:41:14.763329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T05:41:14.629752Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.629752Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:a9d2e6c56d3170f52a08ccdcc69bc9cd757084cabd5024f323ec8382c690d652","observation_id":"094a470d-2194-4559-bdd4-ab9441d562f3","resolution":{"observed_at":"2026-08-07T05:41:14.629752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.750346Z","title":"Games\" and","venue":null,"work_id":"7594b034-2444-42bb-9cbe-38dcf7a8d29d","year":2019},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.633110Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:8f22cf29ebeeaef98cb502e83028a30e532cce594f1dd4e5a949b4c1f2f0a88a","observation_id":"730a1797-7f91-41a9-a855-48e534836ef8","resolution":{"observed_at":"2026-08-07T05:41:14.753261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:14.739987Z","title":null,"venue":null,"work_id":"9b90dfca-4382-49a8-9a57-066f6bca30f3","year":null},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.636513Z"},"links":{"citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:7a3f4b1fd1ce208256a62ed977636e66ab5ecf45c6ef51ec78886ee912df8d4a","observation_id":"02d8a56d-45ad-4bdd-ac3c-98ac11d90f2d","resolution":{"observed_at":"2026-08-07T05:41:14.743827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.07463."}