{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:JT6BNY5VF3365YGGWKP3O34TCC","short_pith_number":"pith:JT6BNY5V","schema_version":"1.0","canonical_sha256":"4cfc16e3b52ef7eee0c6b29fb76f93109ed5f98bd59d16bf2aa01065f348799a","source":{"kind":"arxiv","id":"2105.08209","version":2},"attestation_state":"computed","paper":{"title":"BookSum: A Collection of Datasets for Long-form Narrative Summarization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Caiming Xiong, Divyansh Agarwal, Dragomir Radev, Nazneen Rajani, Wojciech Kry\\'sci\\'nski","submitted_at":"2021-05-18T00:22:46Z","abstract_excerpt":"The majority of available text summarization datasets include short-form source documents that lack long-range causal and temporal dependencies, and often contain strong layout and stylistic biases. While relevant, such datasets will offer limited challenges for future generations of text summarization systems. We address these issues by introducing BookSum, a collection of datasets for long-form narrative summarization. Our dataset covers source documents from the literature domain, such as novels, plays and stories, and includes highly abstractive, human written summaries on three levels of "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2105.08209","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2021-05-18T00:22:46Z","cross_cats_sorted":[],"title_canon_sha256":"3c6cd61f924e2dda056023b5f461a494dadac3c1d77271f0a6a5784cea379775","abstract_canon_sha256":"d1d55b9d59ca95151f4eac3542abcec03dd8be7867e95c4381d745f6f63f02d7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:23:06.714211Z","signature_b64":"5JvevsgXI0NqVLZpgOmEzP3HxXt7r7jBwD9uJhEJ0oGC6Md95U4u+YGWKM7r4EyKEbEf6TNfmSQZadoMT4/3Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4cfc16e3b52ef7eee0c6b29fb76f93109ed5f98bd59d16bf2aa01065f348799a","last_reissued_at":"2026-07-05T05:23:06.713764Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:23:06.713764Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"BookSum: A Collection of Datasets for Long-form Narrative Summarization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Caiming Xiong, Divyansh Agarwal, Dragomir Radev, Nazneen Rajani, Wojciech Kry\\'sci\\'nski","submitted_at":"2021-05-18T00:22:46Z","abstract_excerpt":"The majority of available text summarization datasets include short-form source documents that lack long-range causal and temporal dependencies, and often contain strong layout and stylistic biases. While relevant, such datasets will offer limited challenges for future generations of text summarization systems. We address these issues by introducing BookSum, a collection of datasets for long-form narrative summarization. Our dataset covers source documents from the literature domain, such as novels, plays and stories, and includes highly abstractive, human written summaries on three levels of "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2105.08209","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2105.08209/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2105.08209","created_at":"2026-07-05T05:23:06.713827+00:00"},{"alias_kind":"arxiv_version","alias_value":"2105.08209v2","created_at":"2026-07-05T05:23:06.713827+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2105.08209","created_at":"2026-07-05T05:23:06.713827+00:00"},{"alias_kind":"pith_short_12","alias_value":"JT6BNY5VF336","created_at":"2026-07-05T05:23:06.713827+00:00"},{"alias_kind":"pith_short_16","alias_value":"JT6BNY5VF3365YGG","created_at":"2026-07-05T05:23:06.713827+00:00"},{"alias_kind":"pith_short_8","alias_value":"JT6BNY5V","created_at":"2026-07-05T05:23:06.713827+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.25796","citing_title":"SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2509.17396","citing_title":"EpiCache: Episodic KV Cache Management for Long-Term Conversation on Resource-Constrained Environments","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2404.07143","citing_title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12956","citing_title":"Discovery-Oriented Faceting: From Coverage to Blind-Spot Discovery","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2502.05171","citing_title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","ref_index":85,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC","json":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC.json","graph_json":"https://pith.science/api/pith-number/JT6BNY5VF3365YGGWKP3O34TCC/graph.json","events_json":"https://pith.science/api/pith-number/JT6BNY5VF3365YGGWKP3O34TCC/events.json","paper":"https://pith.science/paper/JT6BNY5V"},"agent_actions":{"view_html":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC","download_json":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC.json","view_paper":"https://pith.science/paper/JT6BNY5V","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2105.08209&json=true","fetch_graph":"https://pith.science/api/pith-number/JT6BNY5VF3365YGGWKP3O34TCC/graph.json","fetch_events":"https://pith.science/api/pith-number/JT6BNY5VF3365YGGWKP3O34TCC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC/action/storage_attestation","attest_author":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC/action/author_attestation","sign_citation":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC/action/citation_signature","submit_replication":"https://pith.science/pith/JT6BNY5VF3365YGGWKP3O34TCC/action/replication_record"}},"created_at":"2026-07-05T05:23:06.713827+00:00","updated_at":"2026-07-05T05:23:06.713827+00:00"}