{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:H252C2CDX4T7FVGC22JXYFC6RL","short_pith_number":"pith:H252C2CD","schema_version":"1.0","canonical_sha256":"3ebba16843bf27f2d4c2d6937c145e8af72cd1a3eea2eeba14daec02a7cb8434","source":{"kind":"arxiv","id":"2305.17116","version":2},"attestation_state":"computed","paper":{"title":"Improving accuracy of GPT-3/4 results on biomedical data using a retrieval-augmented language model","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Ana Caroline Costa S\\'a, Brandon W Higgs, Christina Y Yu, David Soong, Han Si, Hisham Hamadeh, Jan-Samuel Wagner, Kubra Karagoz, Meijian Guan, Sriram Sridhar","submitted_at":"2023-05-26T17:33:05Z","abstract_excerpt":"Large language models (LLMs) have made significant advancements in natural language processing (NLP). Broad corpora capture diverse patterns but can introduce irrelevance, while focused corpora enhance reliability by reducing misleading information. Training LLMs on focused corpora poses computational challenges. An alternative approach is to use a retrieval-augmentation (RetA) method tested in a specific domain.\n  To evaluate LLM performance, OpenAI's GPT-3, GPT-4, Bing's Prometheus, and a custom RetA model were compared using 19 questions on diffuse large B-cell lymphoma (DLBCL) disease. Eig"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.17116","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-05-26T17:33:05Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"ad8f8496fd6d1eee70afd820b0be2480cdde36568812a5ac7fae5cb364e5697b","abstract_canon_sha256":"11679706265747cbcdb494bfaf68af88494b5c372528db12873fc3d273a78b0b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:59:02.759241Z","signature_b64":"4cBovBF3TyOI68UQYI5P9Dg76nefxhfSYIiBjJ0nzczFRorR50MDP291xdAMaTpXqn/AO07z1hnDDKgkQUCYBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3ebba16843bf27f2d4c2d6937c145e8af72cd1a3eea2eeba14daec02a7cb8434","last_reissued_at":"2026-07-05T08:59:02.758668Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:59:02.758668Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Improving accuracy of GPT-3/4 results on biomedical data using a retrieval-augmented language model","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Ana Caroline Costa S\\'a, Brandon W Higgs, Christina Y Yu, David Soong, Han Si, Hisham Hamadeh, Jan-Samuel Wagner, Kubra Karagoz, Meijian Guan, Sriram Sridhar","submitted_at":"2023-05-26T17:33:05Z","abstract_excerpt":"Large language models (LLMs) have made significant advancements in natural language processing (NLP). Broad corpora capture diverse patterns but can introduce irrelevance, while focused corpora enhance reliability by reducing misleading information. Training LLMs on focused corpora poses computational challenges. An alternative approach is to use a retrieval-augmentation (RetA) method tested in a specific domain.\n  To evaluate LLM performance, OpenAI's GPT-3, GPT-4, Bing's Prometheus, and a custom RetA model were compared using 19 questions on diffuse large B-cell lymphoma (DLBCL) disease. Eig"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.17116","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.17116/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.17116","created_at":"2026-07-05T08:59:02.758730+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.17116v2","created_at":"2026-07-05T08:59:02.758730+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.17116","created_at":"2026-07-05T08:59:02.758730+00:00"},{"alias_kind":"pith_short_12","alias_value":"H252C2CDX4T7","created_at":"2026-07-05T08:59:02.758730+00:00"},{"alias_kind":"pith_short_16","alias_value":"H252C2CDX4T7FVGC","created_at":"2026-07-05T08:59:02.758730+00:00"},{"alias_kind":"pith_short_8","alias_value":"H252C2CD","created_at":"2026-07-05T08:59:02.758730+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL","json":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL.json","graph_json":"https://pith.science/api/pith-number/H252C2CDX4T7FVGC22JXYFC6RL/graph.json","events_json":"https://pith.science/api/pith-number/H252C2CDX4T7FVGC22JXYFC6RL/events.json","paper":"https://pith.science/paper/H252C2CD"},"agent_actions":{"view_html":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL","download_json":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL.json","view_paper":"https://pith.science/paper/H252C2CD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.17116&json=true","fetch_graph":"https://pith.science/api/pith-number/H252C2CDX4T7FVGC22JXYFC6RL/graph.json","fetch_events":"https://pith.science/api/pith-number/H252C2CDX4T7FVGC22JXYFC6RL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL/action/storage_attestation","attest_author":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL/action/author_attestation","sign_citation":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL/action/citation_signature","submit_replication":"https://pith.science/pith/H252C2CDX4T7FVGC22JXYFC6RL/action/replication_record"}},"created_at":"2026-07-05T08:59:02.758730+00:00","updated_at":"2026-07-05T08:59:02.758730+00:00"}