{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:URTBIWRMGBZNWHOJKEZNXIBRFF","short_pith_number":"pith:URTBIWRM","schema_version":"1.0","canonical_sha256":"a466145a2c3072db1dc95132dba0312963dffdf4b902d8644e4c726832fc4604","source":{"kind":"arxiv","id":"2504.06196","version":1},"attestation_state":"computed","paper":{"title":"TxGemma: Efficient and Agentic LLMs for Therapeutics","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"David Fleet, Eric Wang, Fan Zhang, Joelle Barral, Paul F. Jaeger, Rory Pilgrim, Samuel Schmidgall, Shekoofeh Azizi, Yossi Matias","submitted_at":"2025-04-08T16:39:02Z","abstract_excerpt":"Therapeutic development is a costly and high-risk endeavor that is often plagued by high failure rates. To address this, we introduce TxGemma, a suite of efficient, generalist large language models (LLMs) capable of therapeutic property prediction as well as interactive reasoning and explainability. Unlike task-specific models, TxGemma synthesizes information from diverse sources, enabling broad application across the therapeutic development pipeline. The suite includes 2B, 9B, and 27B parameter models, fine-tuned from Gemma-2 on a comprehensive dataset of small molecules, proteins, nucleic ac"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.06196","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-04-08T16:39:02Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"db6151c8c7d37c3f7fdf71b874afd8cca6cdd3e7589bf24b0237fef823a71493","abstract_canon_sha256":"30372ef435c677b899f4776f8024a2749df307f3c110f2820defcb0a9e49a456"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:46:16.992006Z","signature_b64":"qWUu4sF+FeJqA6A8qZulrAr6UFhGM6TBEMguwuDmldb333sKG0VgO0o1nqdeawGu+jxUPq5P3UQVBiktkd3aAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a466145a2c3072db1dc95132dba0312963dffdf4b902d8644e4c726832fc4604","last_reissued_at":"2026-07-05T10:46:16.991523Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:46:16.991523Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TxGemma: Efficient and Agentic LLMs for Therapeutics","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"David Fleet, Eric Wang, Fan Zhang, Joelle Barral, Paul F. Jaeger, Rory Pilgrim, Samuel Schmidgall, Shekoofeh Azizi, Yossi Matias","submitted_at":"2025-04-08T16:39:02Z","abstract_excerpt":"Therapeutic development is a costly and high-risk endeavor that is often plagued by high failure rates. To address this, we introduce TxGemma, a suite of efficient, generalist large language models (LLMs) capable of therapeutic property prediction as well as interactive reasoning and explainability. Unlike task-specific models, TxGemma synthesizes information from diverse sources, enabling broad application across the therapeutic development pipeline. The suite includes 2B, 9B, and 27B parameter models, fine-tuned from Gemma-2 on a comprehensive dataset of small molecules, proteins, nucleic ac"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.06196","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.06196/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.06196","created_at":"2026-07-05T10:46:16.991585+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.06196v1","created_at":"2026-07-05T10:46:16.991585+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.06196","created_at":"2026-07-05T10:46:16.991585+00:00"},{"alias_kind":"pith_short_12","alias_value":"URTBIWRMGBZN","created_at":"2026-07-05T10:46:16.991585+00:00"},{"alias_kind":"pith_short_16","alias_value":"URTBIWRMGBZNWHOJ","created_at":"2026-07-05T10:46:16.991585+00:00"},{"alias_kind":"pith_short_8","alias_value":"URTBIWRM","created_at":"2026-07-05T10:46:16.991585+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.08071","citing_title":"SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models","ref_index":74,"is_internal_anchor":false},{"citing_arxiv_id":"2508.12035","citing_title":"ToxiEval-ZKP: A Structure-Private Verification Framework for Molecular Toxicity Repair Tasks","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10978","citing_title":"VibeProteinBench: An Evaluation Benchmark for Language-interfaced Vibe Protein Design","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03361","citing_title":"The limits of bio-molecular modeling with large language models : a cross-scale evaluation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12181","citing_title":"MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10978","citing_title":"VibeProteinBench: An Evaluation Benchmark for Language-interfaced Vibe Protein Design","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03205","citing_title":"From Knowledge to Action: Outcomes of the 2025 Large Language Model (LLM) Hackathon for Applications in Materials Science and Chemistry","ref_index":81,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02745","citing_title":"Bolek: A Multimodal Language Model for Molecular Reasoning","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06728","citing_title":"OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17282","citing_title":"MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02669","citing_title":"An explainable hypothesis-driven approach to Drug-Induced Liver Injury with HADES","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04265","citing_title":"Benchmarking open-source tools for in silico antiviral drug discovery","ref_index":43,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF","json":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF.json","graph_json":"https://pith.science/api/pith-number/URTBIWRMGBZNWHOJKEZNXIBRFF/graph.json","events_json":"https://pith.science/api/pith-number/URTBIWRMGBZNWHOJKEZNXIBRFF/events.json","paper":"https://pith.science/paper/URTBIWRM"},"agent_actions":{"view_html":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF","download_json":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF.json","view_paper":"https://pith.science/paper/URTBIWRM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.06196&json=true","fetch_graph":"https://pith.science/api/pith-number/URTBIWRMGBZNWHOJKEZNXIBRFF/graph.json","fetch_events":"https://pith.science/api/pith-number/URTBIWRMGBZNWHOJKEZNXIBRFF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF/action/storage_attestation","attest_author":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF/action/author_attestation","sign_citation":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF/action/citation_signature","submit_replication":"https://pith.science/pith/URTBIWRMGBZNWHOJKEZNXIBRFF/action/replication_record"}},"created_at":"2026-07-05T10:46:16.991585+00:00","updated_at":"2026-07-05T10:46:16.991585+00:00"}