Pith. sign in

Paper Citation Record · LEDGER

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA

As of 7 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.27566.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.27566 v1

Coverage vector

measured 33 of 33 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-01T05:36:47.916051Z

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

33 of 33 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved33
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 92d90c14-5eb7-4e2b-a637-cd8bcb9bf0e7 · outbound

This paper cites Lawrence Zitnick, and Devi Parikh.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Lawrence Zitnick, and Devi Parikh

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:44.816566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:44.816566Z digest=sha256:28758610c68b67f859e09fade551f7648ce9d4e161976b993ac4322267cef305

Observation da340ddf-4a0f-4494-8801-ff5e61ec899e · outbound

This paper cites M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:44.874743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:44.874743Z digest=sha256:230757fa84297cc59b6a9a1ef96493622e136b8734d3dca03e2bc3943e988af3

Observation 26a126a6-b1d7-4f4e-8e07-73a3da1e33eb · outbound

This paper cites Qwen2.5-VL Technical Report.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Qwen2.5-VL Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:44.932686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:44.932686Z digest=sha256:4e9e14f5a1092112c6ae12933cf4c2c60f1ca367ec9991eeb0b343f56a8d746d

Observation 6fc5ce1a-aa09-4eaf-b3f3-95623a3cb927 · outbound

This paper cites Hasan, Viji Datla, Joey Liu, Dina Demner-Fushman, and Henning Müller.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Hasan, Viji Datla, Joey Liu, Dina Demner-Fushman, and Henning Müller

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.024731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.024731Z digest=sha256:9371ef338e6be88bb74721ae55e7841ca5c791c45b4b4df0fb1e4ebe56346749

Observation 4e0c6ab2-59c4-4489-98e7-58ece449b450 · outbound

This paper cites Hasan, Dina Demner- Fushman, and Henning Müller.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Hasan, Dina Demner- Fushman, and Henning Müller

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.087649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.087649Z digest=sha256:ea8853d248e0f39cf98e9828d7e154b3492d7c01e099af2047b66d9fa824e9e3

Observation 2246ef7e-d5c6-45be-bcc4-6ebde0bb7290 · outbound

This paper cites GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.204851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.204851Z digest=sha256:dd88c06776787f5f8822681a7ec72e0a5898d057c8357be3a51a89c6e2a563d1

Observation c7ab98d3-0b8d-4906-b246-946d6cb9b01e · outbound

This paper cites QLoRA: Efficient finetuning of quantized LLMs.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA QLoRA: Efficient finetuning of quantized LLMs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.311481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.311481Z digest=sha256:4b9eac3ac70d1008e9b4bf616edb7df1ae3ae2c7a38856445037417c9f768438

Observation eb3681de-8184-4425-957c-c72a5e0a6e94 · outbound

This paper cites Making the V in VQA matter: El- evating the role of image understanding in visual question answering.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Making the V in VQA matter: El- evating the role of image understanding in visual question answering

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.424748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.424748Z digest=sha256:1ab4074472200a6dd942f9ff08593fcc4758d6410da7cfed533d1264691d4dfe

Observation 42443079-83b5-4bfd-8d1b-0288c37eeb32 · outbound

This paper cites Weinberger.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Weinberger

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.509741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.509741Z digest=sha256:f4ff03747e8c9d801f21918ee11a57f0fefee925e7dca0e83bdb886f9f2a5324

Observation 6b9a3859-cb68-40c5-af3d-3e97addd96f6 · outbound

This paper cites PathVQA: 30000+ Questions for Medical Visual Question Answering.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA PathVQA: 30000+ Questions for Medical Visual Question Answering

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.624752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.624752Z digest=sha256:757855d81db01f1cf4f8ed6dd9931969e3ef11274614d0e6d830fd3576777b6d

Observation 59322fb7-adb5-44cb-bb5d-75324ee4546c · outbound

This paper cites Parameter-efficient transfer learning for NLP.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Parameter-efficient transfer learning for NLP

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.744818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.744818Z digest=sha256:b4321fdd145ff0e703a2260ab02e1f2a5934d7f200e7f0cce60747c320400840

Observation dfe7fe3e-de5b-4ef1-849f-2fc60a68f212 · outbound

This paper cites Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.854878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.854878Z digest=sha256:0cae44e7edeffdf825720fe7fdc7857bf411a76bc48f9a62710e373bb0e9b522

Observation 7965b055-8780-4c4c-a3a8-0caab3789560 · outbound

This paper cites OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:45.936165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:45.936165Z digest=sha256:e5f97afe7806bb7eb2557cc1ea34882ae601855deb2e72bd15f492f7d244a594

Observation 9b453fc6-b066-4b52-9bfd-a9d167887a0c · outbound

This paper cites MAIRA-1: A specialised large multimodal model for radiology report generation.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MAIRA-1: A specialised large multimodal model for radiology report generation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.055278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.055278Z digest=sha256:322d6af70ae7ca2d1ce768b35e4f8411ef6d3751bcbb13dc7a0a5919ef59fe26

Observation 34e3cef9-ee20-43df-b480-33cd151c4c0f · outbound

This paper cites Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.184871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.184871Z digest=sha256:4411a9c5798800262fe1d3eaee30248babdeacf94d35dced1591304d260d09f2

Observation 04364a3b-f633-49ea-95c0-9be6d30c1847 · outbound

This paper cites Med-R1: Reinforcement learning for general- izable medical reasoning in vision-language models.arXiv preprint arXiv:2503.13939, 2025.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Med-R1: Reinforcement learning for general- izable medical reasoning in vision-language models.arXiv preprint arXiv:2503.13939, 2025

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.265483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.265483Z digest=sha256:9db4fdbada5f9be89d38f69350395a8995c169a60267a2668cea72039c4ed805

Observation 722ab380-ddf7-44ed-8f8d-e486edc523fb · outbound

This paper cites ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.355250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.355250Z digest=sha256:cf8a1c047af68461a3c57cd642fc3706a93a5f470392733da2ff9445bf1f22fa

Observation 5e39045d-0c3b-4a01-92e0-a4743ae157af · outbound

This paper cites Lau, Soumya Gayen, Asma Ben Abacha, and Dina Demner-Fushman.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Lau, Soumya Gayen, Asma Ben Abacha, and Dina Demner-Fushman

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.444919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.444919Z digest=sha256:cad3a6a9df28a7da039a5289cf4003e8617a0f7e38db109ca54fd825dc5341b9

Observation aed25e68-6993-4179-bc55-1ae78e9bf0ba · outbound

This paper cites The Power of Scale for Parameter-Efficient Prompt Tuning.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA The Power of Scale for Parameter-Efficient Prompt Tuning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.525555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.525555Z digest=sha256:751ac31dd5b710c8a3f6ef248d394755c3897dd94c72c9a4ba532b096198d064

Observation 9d06125f-63b5-4124-8d74-44ccb8dcc916 · outbound

This paper cites Llava-med: Training a large language- and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems Workshop, 2023.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Llava-med: Training a large language- and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems Workshop, 2023

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.594750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.594750Z digest=sha256:f11854cbff7e396be6ab3b0a035fbb0a9ac91692226984823d91e4168a5aabd3

Observation aa4fb88a-665d-4d8c-be34-becd4f9016ef · outbound

This paper cites SLAKE: A semantically-labeled knowledge- enhanced dataset for medical visual question answering.IEEE International Symposium on Biomedical Imaging, 2021.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA SLAKE: A semantically-labeled knowledge- enhanced dataset for medical visual question answering.IEEE International Symposium on Biomedical Imaging, 2021

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.717156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.717156Z digest=sha256:9caf7907772991f55765911440204fcbdd1e5eeab3c88187bb9ba59b7de0eacc

Observation 27b95a77-2560-4073-9f5d-e33643a84344 · outbound

This paper cites MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.863899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.863899Z digest=sha256:0ca640928def0973aed53029b60e1b337fce5afb74bbd5395980aaaa0537b231

Observation 344d7cca-9726-499a-bc97-5f384af472db · outbound

This paper cites Capabilities of Gemini Models in Medicine.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Capabilities of Gemini Models in Medicine

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:46.988591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:46.988591Z digest=sha256:891c81e2ba5aeccc6d86203e59e82ea8c2b1642eec0a6bff6bf64b6a08898386

Observation a8def603-deb7-4472-9333-87e62e7df019 · outbound

This paper cites MedGemma Technical Report.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MedGemma Technical Report

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.031623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.031623Z digest=sha256:7a2a11656d3ece1742c023bbc4cb50b1eecd337289fa64d09e4f4c0534e25822

Observation 7de6ce45-c048-4e0d-a5ac-d13ce1527acc · outbound

This paper cites MedGemma 1.5 Technical Report.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MedGemma 1.5 Technical Report

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.096664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.096664Z digest=sha256:c808bad15549b746904d61663bc6ab650d844c5a97510d845ddb1729ba5fc1e7

Observation e3406929-3acf-446a-b1de-c8fe484833c8 · outbound

This paper cites Towards Generalist Biomedical AI.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Towards Generalist Biomedical AI

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.156307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.156307Z digest=sha256:c82043dd058f0580eb1e29de063331ac37aaf07f68af505798bd8bfb78176c82

Observation 9351bd6f-1bf1-443f-935a-8267dc6d5672 · outbound

This paper cites Medframeqa: A multi-image medical vqa benchmark for clinical reasoning.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Medframeqa: A multi-image medical vqa benchmark for clinical reasoning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.245481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.245481Z digest=sha256:567de8eeceaf2797c4b5c3ae18108040610bc394f2b689eec0e47b239b970fdc

Observation e0751bd7-ccf0-4d97-98fe-d715173ee51f · outbound

This paper cites MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.351321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.351321Z digest=sha256:9aa8ec007ee69bd629eb0005a9abf8256c3132d1ca5c3d8435b00fa89665ddbd

Observation 92e7ad95-6397-4483-a6b6-c46313310dd8 · outbound

This paper cites MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.476627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.476627Z digest=sha256:6eb70040c0296f1d2b13ef78b44e4ce58e93e57a5ff12c07bb56ba982235a34c

Observation 0789631e-3c8f-41cf-bd61-37211b387376 · outbound

This paper cites Obtaining calibrated probability estimates from decision trees and naive bayesian classifiers.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Obtaining calibrated probability estimates from decision trees and naive bayesian classifiers

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.590667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.590667Z digest=sha256:50093f79585be7672313b20e21ee37e04c932cfb4ab1bade9f2bc7531bd2ef73

Observation 35dbf2d6-873f-41ce-8ac4-43b898e6a146 · outbound

This paper cites Transforming classifier scores into accurate multiclass probability estimates.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Transforming classifier scores into accurate multiclass probability estimates

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.703886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.703886Z digest=sha256:22da2bfdb3a0410f67d14745f3a0bcaf29d5c35eae33b5428c3e6dbae13ee8a8

Observation e350a18c-7100-4b6a-a739-d884ae3b07e7 · outbound

This paper cites PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.809660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.809660Z digest=sha256:3a703734ed7f71eeb16631a952780f2e7cc512caee662ea8f5929ef51a4bcfda

Observation b6a1f3c6-bcce-4ae2-a7fa-3721e66fa241 · outbound

This paper cites MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding.

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-01T05:36:47.916051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T05:36:47.916051Z digest=sha256:d1add52db05b0a6ecd37f8c0de4c142380b9174aa61ee888e9b3cc11c5f67ef6

Pith citing papers

No inbound Pith citation observations are available.