{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:YIQGK4B5WQATRJH2OZXPUAH3T6","short_pith_number":"pith:YIQGK4B5","schema_version":"1.0","canonical_sha256":"c22065703db40138a4fa766efa00fb9f847c9bde10ae849c5568d2542897d9a7","source":{"kind":"arxiv","id":"2603.27465","version":2},"attestation_state":"computed","paper":{"title":"Poisoning the Genome: Targeted Backdoor Attacks on DNA Foundation Models","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":[],"primary_cat":"q-bio.GN","authors_text":"Charalampos Koilakos, Ilias Georgakopoulos-Soares, Ioannis Mouratidis","submitted_at":"2026-03-29T00:59:10Z","abstract_excerpt":"Foundation models trained on DNA sequences have achieved strong performance across biological tasks including variant effect prediction and genome design. These models rely on massive public genomic datasets comprising trillions of nucleotide tokens. Unlike natural language, DNA sequences lack semantic transparency, making corrupted or adversarially crafted entries difficult to detect during data curation. We present the first systematic study of training data poisoning in genomic language models, targeting both pre-training and fine-tuning stages. At pre-training, using Evo 2 and GENERator ar"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2603.27465","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"q-bio.GN","submitted_at":"2026-03-29T00:59:10Z","cross_cats_sorted":[],"title_canon_sha256":"0c38ced3b6bbbdea550f9019a339c2b860dd199dfe05e4066397e01e1a89c0de","abstract_canon_sha256":"c75a6084275b17ffad94afad314484a0580b292a92ba5da15f8560fc2bb64763"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-06-19T16:11:22.542141Z","signature_b64":"qIB0l9leBKPs8YVerlkrH2UVnEBSSLezseyAcSEI4+P6KqUIvafTw7Z77pi0Q8rcBdQrEmezbk516b3ne8fFCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c22065703db40138a4fa766efa00fb9f847c9bde10ae849c5568d2542897d9a7","last_reissued_at":"2026-06-19T16:11:22.541712Z","signature_status":"signed_v1","first_computed_at":"2026-06-19T16:11:22.541712Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Poisoning the Genome: Targeted Backdoor Attacks on DNA Foundation Models","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":[],"primary_cat":"q-bio.GN","authors_text":"Charalampos Koilakos, Ilias Georgakopoulos-Soares, Ioannis Mouratidis","submitted_at":"2026-03-29T00:59:10Z","abstract_excerpt":"Foundation models trained on DNA sequences have achieved strong performance across biological tasks including variant effect prediction and genome design. These models rely on massive public genomic datasets comprising trillions of nucleotide tokens. Unlike natural language, DNA sequences lack semantic transparency, making corrupted or adversarially crafted entries difficult to detect during data curation. We present the first systematic study of training data poisoning in genomic language models, targeting both pre-training and fine-tuning stages. At pre-training, using Evo 2 and GENERator ar"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2603.27465","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2603.27465/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2603.27465","created_at":"2026-06-19T16:11:22.541769+00:00"},{"alias_kind":"arxiv_version","alias_value":"2603.27465v2","created_at":"2026-06-19T16:11:22.541769+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2603.27465","created_at":"2026-06-19T16:11:22.541769+00:00"},{"alias_kind":"pith_short_12","alias_value":"YIQGK4B5WQAT","created_at":"2026-06-19T16:11:22.541769+00:00"},{"alias_kind":"pith_short_16","alias_value":"YIQGK4B5WQATRJH2","created_at":"2026-06-19T16:11:22.541769+00:00"},{"alias_kind":"pith_short_8","alias_value":"YIQGK4B5","created_at":"2026-06-19T16:11:22.541769+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2608.06779","citing_title":"Genotypic Triggers: Exposing Pharmacogenomic Blind Spots via Host-Specific Backdoors in Generative Antimicrobial Peptide Models","ref_index":25,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6","json":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6.json","graph_json":"https://pith.science/api/pith-number/YIQGK4B5WQATRJH2OZXPUAH3T6/graph.json","events_json":"https://pith.science/api/pith-number/YIQGK4B5WQATRJH2OZXPUAH3T6/events.json","paper":"https://pith.science/paper/YIQGK4B5"},"agent_actions":{"view_html":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6","download_json":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6.json","view_paper":"https://pith.science/paper/YIQGK4B5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2603.27465&json=true","fetch_graph":"https://pith.science/api/pith-number/YIQGK4B5WQATRJH2OZXPUAH3T6/graph.json","fetch_events":"https://pith.science/api/pith-number/YIQGK4B5WQATRJH2OZXPUAH3T6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6/action/storage_attestation","attest_author":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6/action/author_attestation","sign_citation":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6/action/citation_signature","submit_replication":"https://pith.science/pith/YIQGK4B5WQATRJH2OZXPUAH3T6/action/replication_record"}},"created_at":"2026-06-19T16:11:22.541769+00:00","updated_at":"2026-06-19T16:11:22.541769+00:00"}