{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:MAQCKNRUXZDBLSI6TUYAOCZKHR","short_pith_number":"pith:MAQCKNRU","schema_version":"1.0","canonical_sha256":"6020253634be4615c91e9d30070b2a3c5c743c1455e1d5ffa1bcfbef2022901b","source":{"kind":"arxiv","id":"2408.08704","version":2},"attestation_state":"computed","paper":{"title":"Beyond the Hype: A dispassionate look at vision-language models in medical scenario","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Guang Yang, Huichi Zhou, Xiaodan Xing, Yang Nan","submitted_at":"2024-08-16T12:32:44Z","abstract_excerpt":"Recent advancements in Large Vision-Language Models (LVLMs) have demonstrated remarkable capabilities across diverse tasks, garnering significant attention in AI communities. However, their performance and reliability in specialized domains such as medicine remain insufficiently assessed. In particular, most assessments over-concentrate on evaluating VLMs based on simple Visual Question Answering (VQA) on multi-modality data, while ignoring the in-depth characteristics of LVLMs. In this study, we introduce RadVUQA, a novel Radiological Visual Understanding and Question Answering benchmark, to "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.08704","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.CV","submitted_at":"2024-08-16T12:32:44Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"808971ecc31566dce25d44f8d6db1e3c328b381974ebebb39f3a309def917713","abstract_canon_sha256":"f5a3882ab02460b3aedee18ff8d797dbd07f5a176578e860ef2dc43b3308f783"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:28:10.951754Z","signature_b64":"ZaQFbROf9pyWvH7w08VJ2Dg2yj7Ue57cWNV5s8BoUKgmfo/5FAalr65mXJ2+d/G+J5J1jWN/yf7k/1jQseepCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6020253634be4615c91e9d30070b2a3c5c743c1455e1d5ffa1bcfbef2022901b","last_reissued_at":"2026-07-05T11:28:10.951204Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:28:10.951204Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Beyond the Hype: A dispassionate look at vision-language models in medical scenario","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Guang Yang, Huichi Zhou, Xiaodan Xing, Yang Nan","submitted_at":"2024-08-16T12:32:44Z","abstract_excerpt":"Recent advancements in Large Vision-Language Models (LVLMs) have demonstrated remarkable capabilities across diverse tasks, garnering significant attention in AI communities. However, their performance and reliability in specialized domains such as medicine remain insufficiently assessed. In particular, most assessments over-concentrate on evaluating VLMs based on simple Visual Question Answering (VQA) on multi-modality data, while ignoring the in-depth characteristics of LVLMs. In this study, we introduce RadVUQA, a novel Radiological Visual Understanding and Question Answering benchmark, to "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.08704","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.08704/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.08704","created_at":"2026-07-05T11:28:10.951265+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.08704v2","created_at":"2026-07-05T11:28:10.951265+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.08704","created_at":"2026-07-05T11:28:10.951265+00:00"},{"alias_kind":"pith_short_12","alias_value":"MAQCKNRUXZDB","created_at":"2026-07-05T11:28:10.951265+00:00"},{"alias_kind":"pith_short_16","alias_value":"MAQCKNRUXZDBLSI6","created_at":"2026-07-05T11:28:10.951265+00:00"},{"alias_kind":"pith_short_8","alias_value":"MAQCKNRU","created_at":"2026-07-05T11:28:10.951265+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2508.02951","citing_title":"MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine","ref_index":43,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR","json":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR.json","graph_json":"https://pith.science/api/pith-number/MAQCKNRUXZDBLSI6TUYAOCZKHR/graph.json","events_json":"https://pith.science/api/pith-number/MAQCKNRUXZDBLSI6TUYAOCZKHR/events.json","paper":"https://pith.science/paper/MAQCKNRU"},"agent_actions":{"view_html":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR","download_json":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR.json","view_paper":"https://pith.science/paper/MAQCKNRU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.08704&json=true","fetch_graph":"https://pith.science/api/pith-number/MAQCKNRUXZDBLSI6TUYAOCZKHR/graph.json","fetch_events":"https://pith.science/api/pith-number/MAQCKNRUXZDBLSI6TUYAOCZKHR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR/action/storage_attestation","attest_author":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR/action/author_attestation","sign_citation":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR/action/citation_signature","submit_replication":"https://pith.science/pith/MAQCKNRUXZDBLSI6TUYAOCZKHR/action/replication_record"}},"created_at":"2026-07-05T11:28:10.951265+00:00","updated_at":"2026-07-05T11:28:10.951265+00:00"}