{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:M2P3SPPQ3M6W7OQUFWWUIJ64KX","short_pith_number":"pith:M2P3SPPQ","schema_version":"1.0","canonical_sha256":"669fb93df0db3d6fba142dad4427dc55f516dbafb3f0ef046b470cd4db80075c","source":{"kind":"arxiv","id":"2309.09530","version":4},"attestation_state":"computed","paper":{"title":"Adapting Large Language Models to Domains via Reading Comprehension","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Daixuan Cheng, Furu Wei, Shaohan Huang","submitted_at":"2023-09-18T07:17:52Z","abstract_excerpt":"We explore how continued pre-training on domain-specific corpora influences large language models, revealing that training on the raw corpora endows the model with domain knowledge, but drastically hurts its prompting ability for question answering. Taken inspiration from human learning via reading comprehension--practice after reading improves the ability to answer questions based on the learned knowledge--we propose a simple method for transforming raw corpora into reading comprehension texts. Each raw text is enriched with a series of tasks related to its content. Our method, highly scalabl"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2309.09530","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-18T07:17:52Z","cross_cats_sorted":[],"title_canon_sha256":"6113eb21caaf05f8b02f31fcdc48725e9d0cd3ed9dd8952ee07fce62b365f3ed","abstract_canon_sha256":"5e7d7307adf01c2e803c22715e73eb3e448fb52892aa64768bc9533f3a8923c5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:48:11.043527Z","signature_b64":"fOXTcjNxjsF69ra1smq7kIcx1VLCekuU1VJdDG9yxBr+284u1pr5LpXKvbzsGWGYUZNtKZoyftUiE/n1qEz6CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"669fb93df0db3d6fba142dad4427dc55f516dbafb3f0ef046b470cd4db80075c","last_reissued_at":"2026-07-05T08:48:11.043052Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:48:11.043052Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Adapting Large Language Models to Domains via Reading Comprehension","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Daixuan Cheng, Furu Wei, Shaohan Huang","submitted_at":"2023-09-18T07:17:52Z","abstract_excerpt":"We explore how continued pre-training on domain-specific corpora influences large language models, revealing that training on the raw corpora endows the model with domain knowledge, but drastically hurts its prompting ability for question answering. Taken inspiration from human learning via reading comprehension--practice after reading improves the ability to answer questions based on the learned knowledge--we propose a simple method for transforming raw corpora into reading comprehension texts. Each raw text is enriched with a series of tasks related to its content. Our method, highly scalabl"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.09530","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2309.09530/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2309.09530","created_at":"2026-07-05T08:48:11.043108+00:00"},{"alias_kind":"arxiv_version","alias_value":"2309.09530v4","created_at":"2026-07-05T08:48:11.043108+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.09530","created_at":"2026-07-05T08:48:11.043108+00:00"},{"alias_kind":"pith_short_12","alias_value":"M2P3SPPQ3M6W","created_at":"2026-07-05T08:48:11.043108+00:00"},{"alias_kind":"pith_short_16","alias_value":"M2P3SPPQ3M6W7OQU","created_at":"2026-07-05T08:48:11.043108+00:00"},{"alias_kind":"pith_short_8","alias_value":"M2P3SPPQ","created_at":"2026-07-05T08:48:11.043108+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.16517","citing_title":"How Post-Training Shapes Biological Reasoning Models","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26074","citing_title":"StakeBench: Evaluating Language Understanding Grounded in Market Commitment","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2601.11258","citing_title":"Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23809","citing_title":"LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05499","citing_title":"FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX","json":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX.json","graph_json":"https://pith.science/api/pith-number/M2P3SPPQ3M6W7OQUFWWUIJ64KX/graph.json","events_json":"https://pith.science/api/pith-number/M2P3SPPQ3M6W7OQUFWWUIJ64KX/events.json","paper":"https://pith.science/paper/M2P3SPPQ"},"agent_actions":{"view_html":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX","download_json":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX.json","view_paper":"https://pith.science/paper/M2P3SPPQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2309.09530&json=true","fetch_graph":"https://pith.science/api/pith-number/M2P3SPPQ3M6W7OQUFWWUIJ64KX/graph.json","fetch_events":"https://pith.science/api/pith-number/M2P3SPPQ3M6W7OQUFWWUIJ64KX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX/action/storage_attestation","attest_author":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX/action/author_attestation","sign_citation":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX/action/citation_signature","submit_replication":"https://pith.science/pith/M2P3SPPQ3M6W7OQUFWWUIJ64KX/action/replication_record"}},"created_at":"2026-07-05T08:48:11.043108+00:00","updated_at":"2026-07-05T08:48:11.043108+00:00"}