A paragraph-level LLM-annotated biomedical corpus from PMC-OA, distilled into a classifier, enables targeted clinical and educational filtering that improves medical pretraining efficiency.
Measuring massive multitask language understanding
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Biomed-Enriched: A Biomedical Dataset Enriched with LLMs for Pretraining and Extracting Rare and Hidden Content
A paragraph-level LLM-annotated biomedical corpus from PMC-OA, distilled into a classifier, enables targeted clinical and educational filtering that improves medical pretraining efficiency.