Pith. sign in

Paper Citation Record · LEDGER

Evaluating Large Language Models for Evidence-Based Clinical Question Answering

As of 22 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2509.10843.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.10843 v1

Coverage vector

measured 19 of 19 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T15:57:11.870689Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-18T00:23:21.332115Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-18T00:25:32.869703Z

Reference resolution

19 of 19 outbound references displayed

  • verified exact2
  • verified fuzzy6
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bcb98488-40dd-41ff-9e6d-49e7f509fad8 · outbound

This paper cites Guidelines & Statements Search , 2025.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Guidelines & Statements Search , 2025

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:57:12.314139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.751541Z digest=sha256:72724e8918e683f101258badcb36ac55b54370efef7d8da0fad0f7eea2cd3320

Observation 30dbe4df-1018-41f6-9a25-655f54c99ebc · outbound

This paper cites Search Cochrane Library , 2025.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Search Cochrane Library , 2025

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:57:12.287059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.757851Z digest=sha256:0dae89e7d2b4ca286c8ff5b42e2f4c24e7614c93b0945e56a934cbf002c1722d

Observation 70ef8dc9-8e59-4431-b005-c8eacf219689 · outbound

This paper cites Adams, Felix Busch, Conor Fallon, Marc Huppertz, Robert Siepmann, Philipp Prucker, Nadine Bayerl, Daniel Truhn, Marcus Makowski, Alexander Löser, and Keno K.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Adams, Felix Busch, Conor Fallon, Marc Huppertz, Robert Siepmann, Philipp Prucker, Nadine Bayerl, Daniel Truhn, Marcus Makowski, Alexander Löser, and Keno K

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.763055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.763055Z digest=sha256:9fe5ad2b2c5a84d5b5054cee3fa5f320346cc9f79e8677aa165dbb4baa0db0f7

Observation 2745a473-7938-4cbc-9820-b7ebdbd5b8f8 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.768065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.768065Z digest=sha256:aaaa868d7e10508f0ecf279c6f9eecb330273ff3be30e3518441618511eb7192

Observation eaa6e95b-cbb6-4059-98f2-78b3ee41b012 · outbound

This paper cites Evaluating Open-Domain Question Answering in the Era of Large Language Models.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Evaluating Open-Domain Question Answering in the Era of Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.774228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.774228Z digest=sha256:565086b3bdd76db8c41697c2af9fafc9778d13edb3229e13dab609fe591f3d6f

Observation 0f46bea3-b453-41d1-b4c3-da0e09238c22 · outbound

This paper cites Gpt versus resident physicians—a benchmark based on official board scores.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Gpt versus resident physicians—a benchmark based on official board scores

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:57:12.266577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.779711Z digest=sha256:e72f1a173093a11d352720328f52254a005ff055d1cb70708c3b5ad7aa9c3c1b

Observation 0d44aa29-7f2b-43f6-856b-476481a5bf32 · outbound

This paper cites BioASQ - QA : A manually curated corpus for Biomedical Question Answering.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering BioASQ - QA : A manually curated corpus for Biomedical Question Answering

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.786039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.786039Z digest=sha256:7f4303ad39dc8ede25ac49014246b3cbaa0e2ae58fbe7ee03de413a73cfcc1a0

Observation f046df8d-a272-42c6-97cb-7f0d37ff4dc3 · outbound

This paper cites MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.794516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.794516Z digest=sha256:4b6f81996bcd8e3f79c5762291396f168d3a4e55698e333a32d008fd76f1d77d

Observation 3d028c16-2f4b-4767-ac8c-8af172114e6d · outbound

This paper cites Kragen: a knowledge graph-enhanced rag framework for biomedical problem solving using large language models.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Kragen: a knowledge graph-enhanced rag framework for biomedical problem solving using large language models

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:57:12.246089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.807382Z digest=sha256:4ff784c1e724d40fcb449c7292b69c9598976086466179656406cbd347c75283

Observation 38004b69-c1a4-422f-b45d-332e23d7fb2a · outbound

This paper cites Can Large Language Models Match the Conclusions of Systematic Reviews?.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Can Large Language Models Match the Conclusions of Systematic Reviews?

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.817415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.817415Z digest=sha256:7b22f1a8bcc3d0e9fef37a4a1f215a5159199d3289cbecd9927a42e08c9c51cc

Observation 5730e682-1ccd-497d-99f9-070caef9d06d · outbound

This paper cites It’s time to bench the medical exam benchmark, 2025.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering It’s time to bench the medical exam benchmark, 2025

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.824291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.824291Z digest=sha256:a48c8e2f369d7c93afe1413dd9d5c76483b4dea11711895e58616d7110c32cda

Observation ef0b8d0b-1cf0-4530-af33-dc4b39ccbafe · outbound

This paper cites Pfohl, Heather Cole-Lewis, Darlene Neal, Qazi Mamunur Rashid, Mike Schaekermann, Amy Wang, Dev Dash, Jonathan H.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Pfohl, Heather Cole-Lewis, Darlene Neal, Qazi Mamunur Rashid, Mike Schaekermann, Amy Wang, Dev Dash, Jonathan H

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.831315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.831315Z digest=sha256:46135b9e6e965dfeb9eb7bc588264899ca8c7e7475d7759f371ef410d71486ad

Observation 0c7ff269-1589-460e-a44c-c63a88ffbaf3 · outbound

This paper cites Generating explanations in medical question-answering by expectation maximization inference over evidence.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Generating explanations in medical question-answering by expectation maximization inference over evidence

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:57:12.189940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.838822Z digest=sha256:00457720de9e071242a509d89774d6400d8ae055575d4f8a994d3696ceac1360

Observation cc5da50a-e1b7-4687-92f4-4d904113113d · outbound

This paper cites HealthFC: Verifying Health Claims with Evidence-Based Medical Fact-Checking.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering HealthFC: Verifying Health Claims with Evidence-Based Medical Fact-Checking

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.844226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.844226Z digest=sha256:d57f1db0e05bbf5d4aec8d32f844f242a1e90ff0faf8a34c3b3506d8259bc508

Observation 042b0fa7-1595-4ce4-a6d6-74ee3cc69bd5 · outbound

This paper cites MedREQAL: Examining Medical Knowledge Recall of Large Language Models via Question Answering.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering MedREQAL: Examining Medical Knowledge Recall of Large Language Models via Question Answering

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-15T15:57:12.039092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.849680Z digest=sha256:3bb4715a4b84d8ea516cfdff9d1f096b1d5a48a95ec35ffeb5c5b3e859cc9530

Observation b3a15392-64d2-4fc6-9ece-2b41cd517868 · outbound

This paper cites What Evidence Do Language Models Find Convincing?.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering What Evidence Do Language Models Find Convincing?

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.854634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.854634Z digest=sha256:d8c3c199fc2b31f077dde31ae1fb068c8903cd4e9fb931c59c45cda40cb92322

Observation e3eb83bf-ca2e-4428-9af7-9bb8448cca01 · outbound

This paper cites Woolf, Richard Grol, Allen Hutchinson, Martin Eccles, and Jeremy Grimshaw.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Woolf, Richard Grol, Allen Hutchinson, Martin Eccles, and Jeremy Grimshaw

Reference 17

Resolution
verified exact
doi, observed 2026-08-15T15:57:11.943944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.859969Z digest=sha256:c2c6a9b09c79fa8a8bd52b1d7ea6545ae1fac4939d568af02ece8d9f9c131c37

Observation d5141b22-2827-434e-96c4-42d1c9265c09 · outbound

This paper cites Benchmarking retrieval-augmented generation for medicine.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering Benchmarking retrieval-augmented generation for medicine

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:57:12.167816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T15:57:11.865745Z digest=sha256:0fd4177d002da00b480cb2e4205a4b4b7929813e7e4525556a97a877101d698c

Observation e946e8db-9f49-47b7-a1d3-335d06a97acf · outbound

This paper cites MIRIAD: Augmenting LLMs with millions of medical query-response pairs.

Evaluating Large Language Models for Evidence-Based Clinical Question Answering MIRIAD: Augmenting LLMs with millions of medical query-response pairs

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T15:57:11.870689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:57:11.870689Z digest=sha256:166db93e4c1adc4ba85816e44722e57cb835128903095a3619997fcba0d9ac8b

Pith citing papers

Observation 60b077cb-e0be-471b-a74e-db5cbfe18b89 · inbound

Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare cites this paper.

Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare Evaluating Large Language Models for Evidence-Based Clinical Question Answering

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:25:32.872424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-18T00:23:21.332115Z digest=sha256:efed8a0f53bd41bf42ced5607f3631fe2a9e962f1fa074d380a166fc06086abe