{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:IMJYCWRCUXFXKNKTD2SOL6NG3V","short_pith_number":"pith:IMJYCWRC","schema_version":"1.0","canonical_sha256":"4313815a22a5cb7535531ea4e5f9a6dd64a7fe899faaac18fbf5c941c509e620","source":{"kind":"arxiv","id":"2502.21206","version":3},"attestation_state":"computed","paper":{"title":"Chronologically Consistent Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["q-fin.TR"],"primary_cat":"q-fin.GN","authors_text":"Asaf Manela, Jimmy Wu, Linying Lv, Songrun He","submitted_at":"2025-02-28T16:25:50Z","abstract_excerpt":"Large language models are increasingly used in social sciences, but their training data can introduce lookahead bias and training leakage. A good chronologically consistent language model requires efficient use of training data to maintain accuracy despite time-restricted data. Here, we overcome this challenge by training a suite of chronologically consistent large language models, ChronoBERT and ChronoGPT, which incorporate only the text data that would have been available at each point in time. Despite this strict temporal constraint, our models achieve strong performance on natural language"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.21206","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"q-fin.GN","submitted_at":"2025-02-28T16:25:50Z","cross_cats_sorted":["q-fin.TR"],"title_canon_sha256":"7ac2dbd584de26f54746a2fb77acb724c8450f12f4ba8896ed9b38d5c542151c","abstract_canon_sha256":"3887b757bcdcddb15e7fe93de52e952ec54af2ede43c25bf7e72972c09890a84"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:32:25.585747Z","signature_b64":"CrRomYK9sdrA4FZljv1cnWLn8sokvCGBbU0Yw48RG7lsvuZORUIOHJgmmUr0KlI6u6zQCFcTCaHMt5AY65XlCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4313815a22a5cb7535531ea4e5f9a6dd64a7fe899faaac18fbf5c941c509e620","last_reissued_at":"2026-07-05T11:32:25.585003Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:32:25.585003Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Chronologically Consistent Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["q-fin.TR"],"primary_cat":"q-fin.GN","authors_text":"Asaf Manela, Jimmy Wu, Linying Lv, Songrun He","submitted_at":"2025-02-28T16:25:50Z","abstract_excerpt":"Large language models are increasingly used in social sciences, but their training data can introduce lookahead bias and training leakage. A good chronologically consistent language model requires efficient use of training data to maintain accuracy despite time-restricted data. Here, we overcome this challenge by training a suite of chronologically consistent large language models, ChronoBERT and ChronoGPT, which incorporate only the text data that would have been available at each point in time. Despite this strict temporal constraint, our models achieve strong performance on natural language"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.21206","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.21206/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.21206","created_at":"2026-07-05T11:32:25.585095+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.21206v3","created_at":"2026-07-05T11:32:25.585095+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.21206","created_at":"2026-07-05T11:32:25.585095+00:00"},{"alias_kind":"pith_short_12","alias_value":"IMJYCWRCUXFX","created_at":"2026-07-05T11:32:25.585095+00:00"},{"alias_kind":"pith_short_16","alias_value":"IMJYCWRCUXFXKNKT","created_at":"2026-07-05T11:32:25.585095+00:00"},{"alias_kind":"pith_short_8","alias_value":"IMJYCWRC","created_at":"2026-07-05T11:32:25.585095+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27199","citing_title":"Forecasting With LLMs: Improved Generalization Through Feature Steering","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09877","citing_title":"Streaming Knowledge Compilation: Proactive Materiality-Scored Pinning for Time-Evolving LLM Wikis","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29290","citing_title":"Supply Chain Propagation of Textual Signals: LLM Embeddings and Cross-Sectional Return Predictability","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02921","citing_title":"Debiasing LLMs by Fine-tuning","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26747","citing_title":"From Hypotheses to Factors: Constrained LLM Agents in Cryptocurrency Markets","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19476","citing_title":"Cross-Stock Predictability via LLM-Augmented Semantic Networks","ref_index":52,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V","json":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V.json","graph_json":"https://pith.science/api/pith-number/IMJYCWRCUXFXKNKTD2SOL6NG3V/graph.json","events_json":"https://pith.science/api/pith-number/IMJYCWRCUXFXKNKTD2SOL6NG3V/events.json","paper":"https://pith.science/paper/IMJYCWRC"},"agent_actions":{"view_html":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V","download_json":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V.json","view_paper":"https://pith.science/paper/IMJYCWRC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.21206&json=true","fetch_graph":"https://pith.science/api/pith-number/IMJYCWRCUXFXKNKTD2SOL6NG3V/graph.json","fetch_events":"https://pith.science/api/pith-number/IMJYCWRCUXFXKNKTD2SOL6NG3V/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V/action/timestamp_anchor","attest_storage":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V/action/storage_attestation","attest_author":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V/action/author_attestation","sign_citation":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V/action/citation_signature","submit_replication":"https://pith.science/pith/IMJYCWRCUXFXKNKTD2SOL6NG3V/action/replication_record"}},"created_at":"2026-07-05T11:32:25.585095+00:00","updated_at":"2026-07-05T11:32:25.585095+00:00"}