{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:25CMTS7XWSGCDP6YDYPVY3KNQD","short_pith_number":"pith:25CMTS7X","schema_version":"1.0","canonical_sha256":"d744c9cbf7b48c21bfd81e1f5c6d4d80f56e19edf25e25b94b81c9acd8390031","source":{"kind":"arxiv","id":"2211.08112","version":1},"attestation_state":"computed","paper":{"title":"An Efficient Active Learning Pipeline for Legal Text Classification","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Karl Aberer, R\\'emi Lebret, Sepideh Mamooler, St\\'ephane Massonnet","submitted_at":"2022-11-15T13:07:02Z","abstract_excerpt":"Active Learning (AL) is a powerful tool for learning with less labeled data, in particular, for specialized domains, like legal documents, where unlabeled data is abundant, but the annotation requires domain expertise and is thus expensive. Recent works have shown the effectiveness of AL strategies for pre-trained language models. However, most AL strategies require a set of labeled samples to start with, which is expensive to acquire. In addition, pre-trained language models have been shown unstable during fine-tuning with small datasets, and their embeddings are not semantically meaningful. "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2211.08112","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2022-11-15T13:07:02Z","cross_cats_sorted":[],"title_canon_sha256":"739a2beb513bb14ccc732ad005978921c62daca27e84b6ff5a3a95b63960018f","abstract_canon_sha256":"dbb2b6c1bd3ba18478de2ef72aeb7ba0b2855824f7398bdcfd76f86790686546"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:16:10.006246Z","signature_b64":"egHCGneynBfy144WQD5YJHSxiEQhO9QmSSBeS2U0l/Rlk6133q1rp+kWimmsCKsDATcuBMoz4M+C+73/qVtbDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d744c9cbf7b48c21bfd81e1f5c6d4d80f56e19edf25e25b94b81c9acd8390031","last_reissued_at":"2026-07-05T05:16:10.005718Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:16:10.005718Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"An Efficient Active Learning Pipeline for Legal Text Classification","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Karl Aberer, R\\'emi Lebret, Sepideh Mamooler, St\\'ephane Massonnet","submitted_at":"2022-11-15T13:07:02Z","abstract_excerpt":"Active Learning (AL) is a powerful tool for learning with less labeled data, in particular, for specialized domains, like legal documents, where unlabeled data is abundant, but the annotation requires domain expertise and is thus expensive. Recent works have shown the effectiveness of AL strategies for pre-trained language models. However, most AL strategies require a set of labeled samples to start with, which is expensive to acquire. In addition, pre-trained language models have been shown unstable during fine-tuning with small datasets, and their embeddings are not semantically meaningful. "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2211.08112","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2211.08112/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2211.08112","created_at":"2026-07-05T05:16:10.005800+00:00"},{"alias_kind":"arxiv_version","alias_value":"2211.08112v1","created_at":"2026-07-05T05:16:10.005800+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2211.08112","created_at":"2026-07-05T05:16:10.005800+00:00"},{"alias_kind":"pith_short_12","alias_value":"25CMTS7XWSGC","created_at":"2026-07-05T05:16:10.005800+00:00"},{"alias_kind":"pith_short_16","alias_value":"25CMTS7XWSGCDP6Y","created_at":"2026-07-05T05:16:10.005800+00:00"},{"alias_kind":"pith_short_8","alias_value":"25CMTS7X","created_at":"2026-07-05T05:16:10.005800+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2502.03292","citing_title":"ALPET: Active Few-shot Learning for Citation Worthiness Detection in Low-Resource Wikipedia Languages","ref_index":54,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD","json":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD.json","graph_json":"https://pith.science/api/pith-number/25CMTS7XWSGCDP6YDYPVY3KNQD/graph.json","events_json":"https://pith.science/api/pith-number/25CMTS7XWSGCDP6YDYPVY3KNQD/events.json","paper":"https://pith.science/paper/25CMTS7X"},"agent_actions":{"view_html":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD","download_json":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD.json","view_paper":"https://pith.science/paper/25CMTS7X","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2211.08112&json=true","fetch_graph":"https://pith.science/api/pith-number/25CMTS7XWSGCDP6YDYPVY3KNQD/graph.json","fetch_events":"https://pith.science/api/pith-number/25CMTS7XWSGCDP6YDYPVY3KNQD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD/action/storage_attestation","attest_author":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD/action/author_attestation","sign_citation":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD/action/citation_signature","submit_replication":"https://pith.science/pith/25CMTS7XWSGCDP6YDYPVY3KNQD/action/replication_record"}},"created_at":"2026-07-05T05:16:10.005800+00:00","updated_at":"2026-07-05T05:16:10.005800+00:00"}