{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:WFIOVMV7U6J42NO7BI3M55NLLR","short_pith_number":"pith:WFIOVMV7","schema_version":"1.0","canonical_sha256":"b150eab2bfa793cd35df0a36cef5ab5c5a9e6f407ca0e652e6242bbbf1983a1b","source":{"kind":"arxiv","id":"2307.11088","version":3},"attestation_state":"computed","paper":{"title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chenxin An, Jun Zhang, Lingpeng Kong, Ming Zhong, Mukai Li, Shansan Gong, Xingjian Zhao, Xipeng Qiu","submitted_at":"2023-07-20T17:59:41Z","abstract_excerpt":"Recently, there has been growing interest in extending the context length of large language models (LLMs), aiming to effectively process long inputs of one turn or conversations with more extensive histories. While proprietary models such as GPT-4 and Claude can largely preserve the reasoning ability in an extended context, open-source models are still progressing through the early stages of development. To bridge this gap, we propose L-Eval to institute a more standardized evaluation for long context language models (LCLMs) addressing two key aspects: dataset construction and evaluation metri"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2307.11088","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-07-20T17:59:41Z","cross_cats_sorted":[],"title_canon_sha256":"347c6cdaa68ec5257f12f9eaf09053d0534d9a24066c3cffa92db11d911685ef","abstract_canon_sha256":"d0601721372fba67add744f3aefde9e743eeb3869fa32992a709d1d9120be32e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:57:09.208808Z","signature_b64":"o9dzJQCQsQOzI73uZcHjTCCuoW+AlUSANKlQ/vA98aqXplC5hRkexyhM4HEaGyZDnj1u9uMqiv8IGyLQeftKCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b150eab2bfa793cd35df0a36cef5ab5c5a9e6f407ca0e652e6242bbbf1983a1b","last_reissued_at":"2026-07-05T06:57:09.208297Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:57:09.208297Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chenxin An, Jun Zhang, Lingpeng Kong, Ming Zhong, Mukai Li, Shansan Gong, Xingjian Zhao, Xipeng Qiu","submitted_at":"2023-07-20T17:59:41Z","abstract_excerpt":"Recently, there has been growing interest in extending the context length of large language models (LLMs), aiming to effectively process long inputs of one turn or conversations with more extensive histories. While proprietary models such as GPT-4 and Claude can largely preserve the reasoning ability in an extended context, open-source models are still progressing through the early stages of development. To bridge this gap, we propose L-Eval to institute a more standardized evaluation for long context language models (LCLMs) addressing two key aspects: dataset construction and evaluation metri"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2307.11088","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2307.11088/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2307.11088","created_at":"2026-07-05T06:57:09.208367+00:00"},{"alias_kind":"arxiv_version","alias_value":"2307.11088v3","created_at":"2026-07-05T06:57:09.208367+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2307.11088","created_at":"2026-07-05T06:57:09.208367+00:00"},{"alias_kind":"pith_short_12","alias_value":"WFIOVMV7U6J4","created_at":"2026-07-05T06:57:09.208367+00:00"},{"alias_kind":"pith_short_16","alias_value":"WFIOVMV7U6J42NO7","created_at":"2026-07-05T06:57:09.208367+00:00"},{"alias_kind":"pith_short_8","alias_value":"WFIOVMV7","created_at":"2026-07-05T06:57:09.208367+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17391","citing_title":"NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14589","citing_title":"EndPrompt: Efficient Long-Context Extension via Terminal Anchoring","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24414","citing_title":"JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27705","citing_title":"Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding Scaling","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23170","citing_title":"Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2411.15594","citing_title":"A Survey on LLM-as-a-Judge","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2502.01941","citing_title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2403.17297","citing_title":"InternLM2 Technical Report","ref_index":147,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14589","citing_title":"EndPrompt: Efficient Long-Context Extension via Terminal Anchoring","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2403.19887","citing_title":"Jamba: A Hybrid Transformer-Mamba Language Model","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2404.14469","citing_title":"SnapKV: LLM Knows What You are Looking for Before Generation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2308.14508","citing_title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27085","citing_title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03375","citing_title":"Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20131","citing_title":"Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives","ref_index":68,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR","json":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR.json","graph_json":"https://pith.science/api/pith-number/WFIOVMV7U6J42NO7BI3M55NLLR/graph.json","events_json":"https://pith.science/api/pith-number/WFIOVMV7U6J42NO7BI3M55NLLR/events.json","paper":"https://pith.science/paper/WFIOVMV7"},"agent_actions":{"view_html":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR","download_json":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR.json","view_paper":"https://pith.science/paper/WFIOVMV7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2307.11088&json=true","fetch_graph":"https://pith.science/api/pith-number/WFIOVMV7U6J42NO7BI3M55NLLR/graph.json","fetch_events":"https://pith.science/api/pith-number/WFIOVMV7U6J42NO7BI3M55NLLR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR/action/storage_attestation","attest_author":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR/action/author_attestation","sign_citation":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR/action/citation_signature","submit_replication":"https://pith.science/pith/WFIOVMV7U6J42NO7BI3M55NLLR/action/replication_record"}},"created_at":"2026-07-05T06:57:09.208367+00:00","updated_at":"2026-07-05T06:57:09.208367+00:00"}