{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:CKSAKA2MN7KKMY32H6TRRBQZZH","short_pith_number":"pith:CKSAKA2M","schema_version":"1.0","canonical_sha256":"12a405034c6fd4a6637a3fa7188619c9f6029a8aba4883899182c2534e05b02b","source":{"kind":"arxiv","id":"2109.03570","version":2},"attestation_state":"computed","paper":{"title":"Biomedical and Clinical Language Models for Spanish: On the Benefits of Domain-Specific Pretraining in a Mid-Resource Scenario","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Aitor Gonzalez-Agirre, Asier Guti\\'errez-Fandi\\~no, Casimiro Pio Carrino, Joan Llop-Palao, Jordi Armengol-Estap\\'e, Marc P\\`amies, Marta Villegas","submitted_at":"2021-09-08T12:12:07Z","abstract_excerpt":"This work presents biomedical and clinical language models for Spanish by experimenting with different pretraining choices, such as masking at word and subword level, varying the vocabulary size and testing with domain data, looking for better language representations. Interestingly, in the absence of enough clinical data to train a model from scratch, we applied mixed-domain pretraining and cross-domain transfer approaches to generate a performant bio-clinical model suitable for real-world clinical data. We evaluated our models on Named Entity Recognition (NER) tasks for biomedical documents "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2109.03570","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2021-09-08T12:12:07Z","cross_cats_sorted":[],"title_canon_sha256":"4e561c3914eeb3c2e2c54e5bc27d09d7886c188f58db415ae6e62ab2046b991e","abstract_canon_sha256":"1a1d2af4531088396e0c24949dd77f75afd541505234118942efe717038b74ea"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:15:12.049069Z","signature_b64":"FkcouvZmTjzcdGhOsleBKUgvhaSbKFUUKLc16BYKQ+nFfhRMoz2hc4aK+C012fZxx6OHaEA1zOaGCMospMCcAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"12a405034c6fd4a6637a3fa7188619c9f6029a8aba4883899182c2534e05b02b","last_reissued_at":"2026-07-05T03:15:12.048678Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:15:12.048678Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Biomedical and Clinical Language Models for Spanish: On the Benefits of Domain-Specific Pretraining in a Mid-Resource Scenario","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Aitor Gonzalez-Agirre, Asier Guti\\'errez-Fandi\\~no, Casimiro Pio Carrino, Joan Llop-Palao, Jordi Armengol-Estap\\'e, Marc P\\`amies, Marta Villegas","submitted_at":"2021-09-08T12:12:07Z","abstract_excerpt":"This work presents biomedical and clinical language models for Spanish by experimenting with different pretraining choices, such as masking at word and subword level, varying the vocabulary size and testing with domain data, looking for better language representations. Interestingly, in the absence of enough clinical data to train a model from scratch, we applied mixed-domain pretraining and cross-domain transfer approaches to generate a performant bio-clinical model suitable for real-world clinical data. We evaluated our models on Named Entity Recognition (NER) tasks for biomedical documents "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2109.03570","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2109.03570/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2109.03570","created_at":"2026-07-05T03:15:12.048733+00:00"},{"alias_kind":"arxiv_version","alias_value":"2109.03570v2","created_at":"2026-07-05T03:15:12.048733+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2109.03570","created_at":"2026-07-05T03:15:12.048733+00:00"},{"alias_kind":"pith_short_12","alias_value":"CKSAKA2MN7KK","created_at":"2026-07-05T03:15:12.048733+00:00"},{"alias_kind":"pith_short_16","alias_value":"CKSAKA2MN7KKMY32","created_at":"2026-07-05T03:15:12.048733+00:00"},{"alias_kind":"pith_short_8","alias_value":"CKSAKA2M","created_at":"2026-07-05T03:15:12.048733+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH","json":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH.json","graph_json":"https://pith.science/api/pith-number/CKSAKA2MN7KKMY32H6TRRBQZZH/graph.json","events_json":"https://pith.science/api/pith-number/CKSAKA2MN7KKMY32H6TRRBQZZH/events.json","paper":"https://pith.science/paper/CKSAKA2M"},"agent_actions":{"view_html":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH","download_json":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH.json","view_paper":"https://pith.science/paper/CKSAKA2M","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2109.03570&json=true","fetch_graph":"https://pith.science/api/pith-number/CKSAKA2MN7KKMY32H6TRRBQZZH/graph.json","fetch_events":"https://pith.science/api/pith-number/CKSAKA2MN7KKMY32H6TRRBQZZH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH/action/storage_attestation","attest_author":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH/action/author_attestation","sign_citation":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH/action/citation_signature","submit_replication":"https://pith.science/pith/CKSAKA2MN7KKMY32H6TRRBQZZH/action/replication_record"}},"created_at":"2026-07-05T03:15:12.048733+00:00","updated_at":"2026-07-05T03:15:12.048733+00:00"}