{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:OHD2QXOKL4MFLHDDKLKU7GBQVP","short_pith_number":"pith:OHD2QXOK","schema_version":"1.0","canonical_sha256":"71c7a85dca5f18559c6352d54f9830abcd3a46db9780f094a8927ab392bf43a7","source":{"kind":"arxiv","id":"2507.18143","version":2},"attestation_state":"computed","paper":{"title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Bashkim Jaha, Diane Duroux, Gonzalo Cardenal-Antolin, Jacques Fellay, Niko Beerenwinkel, Roger Kouyos","submitted_at":"2025-07-24T07:06:30Z","abstract_excerpt":"Large language models (LLMs) are emerging as valuable tools to support clinicians in routine decision-making. HIV management is a compelling use case due to its complexity, including diverse treatment options, comorbidities, and adherence challenges. However, integrating LLMs into clinical practice raises concerns about accuracy, potential harm, and clinician acceptance. Despite their promise, AI applications in HIV care remain underexplored, and LLM benchmarking studies are scarce. This study evaluates the current capabilities of LLMs in HIV management, highlighting their strengths and limita"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.18143","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-07-24T07:06:30Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"1b31432f51030ae19ee7216327e21ed55015d83440be987ee89c3e8dd43f924f","abstract_canon_sha256":"d6563adcdc58fabb9051f37c0b01f81041efe6485613ca958b4ac14ab618307f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:43:14.790719Z","signature_b64":"4iFbhqL8Gl2Y4EngdQLKpclDdANesrjkXhb9tf2ON4+XGr8Sf+dIAonTOEO/4fndLTa2qz4VMSNiZbrIa+9UCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"71c7a85dca5f18559c6352d54f9830abcd3a46db9780f094a8927ab392bf43a7","last_reissued_at":"2026-07-05T11:43:14.790135Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:43:14.790135Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Bashkim Jaha, Diane Duroux, Gonzalo Cardenal-Antolin, Jacques Fellay, Niko Beerenwinkel, Roger Kouyos","submitted_at":"2025-07-24T07:06:30Z","abstract_excerpt":"Large language models (LLMs) are emerging as valuable tools to support clinicians in routine decision-making. HIV management is a compelling use case due to its complexity, including diverse treatment options, comorbidities, and adherence challenges. However, integrating LLMs into clinical practice raises concerns about accuracy, potential harm, and clinician acceptance. Despite their promise, AI applications in HIV care remain underexplored, and LLM benchmarking studies are scarce. This study evaluates the current capabilities of LLMs in HIV management, highlighting their strengths and limita"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.18143","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.18143/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.18143","created_at":"2026-07-05T11:43:14.790208+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.18143v2","created_at":"2026-07-05T11:43:14.790208+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.18143","created_at":"2026-07-05T11:43:14.790208+00:00"},{"alias_kind":"pith_short_12","alias_value":"OHD2QXOKL4MF","created_at":"2026-07-05T11:43:14.790208+00:00"},{"alias_kind":"pith_short_16","alias_value":"OHD2QXOKL4MFLHDD","created_at":"2026-07-05T11:43:14.790208+00:00"},{"alias_kind":"pith_short_8","alias_value":"OHD2QXOK","created_at":"2026-07-05T11:43:14.790208+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.25273","citing_title":"LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP","json":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP.json","graph_json":"https://pith.science/api/pith-number/OHD2QXOKL4MFLHDDKLKU7GBQVP/graph.json","events_json":"https://pith.science/api/pith-number/OHD2QXOKL4MFLHDDKLKU7GBQVP/events.json","paper":"https://pith.science/paper/OHD2QXOK"},"agent_actions":{"view_html":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP","download_json":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP.json","view_paper":"https://pith.science/paper/OHD2QXOK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.18143&json=true","fetch_graph":"https://pith.science/api/pith-number/OHD2QXOKL4MFLHDDKLKU7GBQVP/graph.json","fetch_events":"https://pith.science/api/pith-number/OHD2QXOKL4MFLHDDKLKU7GBQVP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP/action/storage_attestation","attest_author":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP/action/author_attestation","sign_citation":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP/action/citation_signature","submit_replication":"https://pith.science/pith/OHD2QXOKL4MFLHDDKLKU7GBQVP/action/replication_record"}},"created_at":"2026-07-05T11:43:14.790208+00:00","updated_at":"2026-07-05T11:43:14.790208+00:00"}