{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:7EFKDMU32VRYPPIQEVG72PDYKK","short_pith_number":"pith:7EFKDMU3","schema_version":"1.0","canonical_sha256":"f90aa1b29bd56387bd10254dfd3c785297831199025f1bba34c10910411bc73f","source":{"kind":"arxiv","id":"2607.10849","version":1},"attestation_state":"computed","paper":{"title":"Capabilities of Claude Fable 5 on Biomedical Challenge Problems","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dominic Okonkwo, Magnus Hodgson, Susan Adanna Ihejirika, Temitope I. David","submitted_at":"2026-07-12T17:21:32Z","abstract_excerpt":"Frontier language models are increasingly evaluated on biomedical benchmarks, but two problems undermine most published evaluations: legacy benchmarks are near-saturated, and open-ended responses are graded by other language models. We evaluate Claude Fable 5, Anthropic's most capable publicly available model, across eight biomedical benchmarks, four text and four multimodal, using deterministic scoring against fixed answer keys throughout. We include two Claude predecessors and GPT-5 as baselines. Refusal is tracked as a distinct outcome in every result table. That decision produces the paper"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.10849","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2026-07-12T17:21:32Z","cross_cats_sorted":[],"title_canon_sha256":"75f74d1d319ba224bdc5dd8c89eeeb8623f5da2e599d84de0d961839515bea04","abstract_canon_sha256":"198f2f261cee53ff2cdda89d63bf4a77dbef47ad4c93a4c6b4827ba4f59763f7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-14T01:21:43.449991Z","signature_b64":"DCmoTajU31PQ7xcnLHo9ctzsZblrE8nV1m7zjRbYJgVWs4P9At+P49Nk5Ei/NhHeTkvPUlToAjVmw0pOEb1ICg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f90aa1b29bd56387bd10254dfd3c785297831199025f1bba34c10910411bc73f","last_reissued_at":"2026-07-14T01:21:43.449152Z","signature_status":"signed_v1","first_computed_at":"2026-07-14T01:21:43.449152Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Capabilities of Claude Fable 5 on Biomedical Challenge Problems","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dominic Okonkwo, Magnus Hodgson, Susan Adanna Ihejirika, Temitope I. David","submitted_at":"2026-07-12T17:21:32Z","abstract_excerpt":"Frontier language models are increasingly evaluated on biomedical benchmarks, but two problems undermine most published evaluations: legacy benchmarks are near-saturated, and open-ended responses are graded by other language models. We evaluate Claude Fable 5, Anthropic's most capable publicly available model, across eight biomedical benchmarks, four text and four multimodal, using deterministic scoring against fixed answer keys throughout. We include two Claude predecessors and GPT-5 as baselines. Refusal is tracked as a distinct outcome in every result table. That decision produces the paper"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.10849","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.10849/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.10849","created_at":"2026-07-14T01:21:43.449593+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.10849v1","created_at":"2026-07-14T01:21:43.449593+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.10849","created_at":"2026-07-14T01:21:43.449593+00:00"},{"alias_kind":"pith_short_12","alias_value":"7EFKDMU32VRY","created_at":"2026-07-14T01:21:43.449593+00:00"},{"alias_kind":"pith_short_16","alias_value":"7EFKDMU32VRYPPIQ","created_at":"2026-07-14T01:21:43.449593+00:00"},{"alias_kind":"pith_short_8","alias_value":"7EFKDMU3","created_at":"2026-07-14T01:21:43.449593+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK","json":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK.json","graph_json":"https://pith.science/api/pith-number/7EFKDMU32VRYPPIQEVG72PDYKK/graph.json","events_json":"https://pith.science/api/pith-number/7EFKDMU32VRYPPIQEVG72PDYKK/events.json","paper":"https://pith.science/paper/7EFKDMU3"},"agent_actions":{"view_html":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK","download_json":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK.json","view_paper":"https://pith.science/paper/7EFKDMU3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.10849&json=true","fetch_graph":"https://pith.science/api/pith-number/7EFKDMU32VRYPPIQEVG72PDYKK/graph.json","fetch_events":"https://pith.science/api/pith-number/7EFKDMU32VRYPPIQEVG72PDYKK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK/action/storage_attestation","attest_author":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK/action/author_attestation","sign_citation":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK/action/citation_signature","submit_replication":"https://pith.science/pith/7EFKDMU32VRYPPIQEVG72PDYKK/action/replication_record"}},"created_at":"2026-07-14T01:21:43.449593+00:00","updated_at":"2026-07-14T01:21:43.449593+00:00"}