Pith. sign in

Paper Citation Record · LEDGER

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

As of 18 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2509.24739.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.24739 v4

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T13:51:54.495267Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-15T00:07:22.106337Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-15T00:08:21.640745Z

Reference resolution

62 of 62 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved61
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8c38370a-a958-4da9-828c-af74605bbfd4 · outbound

This paper cites Learning transferable visual models from natural language supervision.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Learning transferable visual models from natural language supervision

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:47.702634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:47.702634Z digest=sha256:02dfc8121067d0692ecf3caa32ad524def38a69e2f0725c3e28d79deb829bb8f

Observation efb95acd-2f58-48cd-8702-e49a2bb1e588 · outbound

This paper cites The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision).

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:47.766115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:47.766115Z digest=sha256:a850c4b29b608ffe52a829f21772b28e6a940525a203736f0159468c20587994

Observation dd9c7bff-10de-48d8-a2b2-4c04ceb2d500 · outbound

This paper cites Claude: An AI Assistant by Anthropic.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Claude: An AI Assistant by Anthropic

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:47.874286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:47.874286Z digest=sha256:f84e1f203a064f496aa134f1a59f633950b399c8cb7f851b4b142b92fa8dc1fa

Observation d0eae354-ee4b-49aa-8711-dc836fee1360 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation LLaVA-OneVision: Easy Visual Task Transfer

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.000430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.000430Z digest=sha256:9ccd3dec9c7c8e8ea871a7f7beb2414c651512c4e067fcaf545c73d4b7474f99

Observation 533063d2-2515-4d9d-85bb-ef3c8313dfa8 · outbound

This paper cites Qwen2.5-VL Technical Report.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.130952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.130952Z digest=sha256:b2b838a7bd2d504ef98ef98f07bb7493cb741e7ec1caf1dd65486b270a327b28

Observation 6310f6eb-de84-4450-b8d4-4bb7ccd2ca31 · outbound

This paper cites Qwen Technical Report.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Qwen Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.230261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.230261Z digest=sha256:4828affc40b12f34a3da50afbdb9c178616e9b92115969f34362e6e57b21b2ed

Observation 5fe60ef1-8e35-4ab6-bd26-5a8499bf9709 · outbound

This paper cites Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.335271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.335271Z digest=sha256:5b342a40dc599834bb24cca7404f49808f2d287d47976c1beae53bf7ad89931e

Observation 830e177a-9c4c-4966-b5da-c71b8159654e · outbound

This paper cites Ahive: Anatomy-aware hierarchical vision encoding for interactive radiology report retrieval.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Ahive: Anatomy-aware hierarchical vision encoding for interactive radiology report retrieval

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.415732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.415732Z digest=sha256:5d4f539f2554c143c6e6f3762b27fa501240506e8b6a33681c16b716d2eca576

Observation 9a581a32-c0f5-425e-a0d9-8bbfc81a0fd9 · outbound

This paper cites Fg-cxr: A radiologist-aligned gaze dataset for enhancing interpretability in chest x-ray report generation.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Fg-cxr: A radiologist-aligned gaze dataset for enhancing interpretability in chest x-ray report generation

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.541080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.541080Z digest=sha256:544a7297ad8ffa9caedc56ee4e1cfe1471cdba73cdd1eb560ad0998838a14000

Observation aed398f9-5b2c-4c37-989c-02e378429813 · outbound

This paper cites Cplip: zero-shot learning for histopathology with comprehensive vision-language alignment.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Cplip: zero-shot learning for histopathology with comprehensive vision-language alignment

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.724997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.724997Z digest=sha256:514b80a050d4e93cbc768f7476856c44909ffaca0f9139d13817f55d6cf6286a

Observation 6792aaef-5272-4ac6-8c45-0e485246dc4a · outbound

This paper cites Flamingo: a Visual Language Model for Few-Shot Learning.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Flamingo: a Visual Language Model for Few-Shot Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:48.855655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:48.855655Z digest=sha256:ad847129f28dedbbc194dc5ba24bf8009432ff3542a3b736d50d4e596d01151e

Observation 6f175081-8ad3-4922-b66d-5c9dc9c64799 · outbound

This paper cites Gpt-4o: Openai’s multimodal model with vision, audio, and text capabilities.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Gpt-4o: Openai’s multimodal model with vision, audio, and text capabilities

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.029921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.029921Z digest=sha256:9bc38b2e3e1b9f7abe6cf21c760de1bfe595fff3edee92f52f1b8ea816669bfa

Observation acac3c1a-a841-4656-8c0a-1cf74bfbb339 · outbound

This paper cites Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.123850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.123850Z digest=sha256:33abd87ca2e4db8f2b7dbbcbdfbfe762a40ecb29d78b6b81805e68ae5d24e299

Observation 248a8d75-52d5-4b6c-ad29-bf398559b881 · outbound

This paper cites Multi- modal understanding and generation for medical images and text via vision-language pre- training.IEEE Journal of Biomedical and Health Informatics, 26(12):6070–6080, 2022.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Multi- modal understanding and generation for medical images and text via vision-language pre- training.IEEE Journal of Biomedical and Health Informatics, 26(12):6070–6080, 2022

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.216358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.216358Z digest=sha256:086b767c6a0e447473274138074ce73722773b181c34f310faaba32ca35a2a11

Observation 3809e221-798a-4ebc-af65-d37677ed2582 · outbound

This paper cites Towards a better understanding of annotation tools for medical imaging: a survey.Multimedia Tools and Applications, 81(18):25877–25911, 2022.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Towards a better understanding of annotation tools for medical imaging: a survey.Multimedia Tools and Applications, 81(18):25877–25911, 2022

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.301934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.301934Z digest=sha256:9b55c09d2246b66fb175c96d8c1cf178392cf056103f10223b9bd2811d01ef90

Observation e55a3f84-04a3-4e81-a9c1-651fc387b386 · outbound

This paper cites Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.388029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.388029Z digest=sha256:686e3f4d712c4c4d4caaf9884c159c6a7cc3abb89355b92e483812c6967c166f

Observation e07c0a1d-f9f9-4033-89a4-c8800c2bc55d · outbound

This paper cites Knowledge matters: Chest radiology report generation with general and specific knowledge.Medical Image Analysis, 80: 102510, 2022.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Knowledge matters: Chest radiology report generation with general and specific knowledge.Medical Image Analysis, 80: 102510, 2022

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.468001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.468001Z digest=sha256:39bcfc3a2cdc831d4be8cb8e0d002fd0b45dacf2ef8487dfb184585fe47b0017

Observation 06e71057-9677-4e54-8c96-3ba3f26dddf3 · outbound

This paper cites Medclip: Contrastive learning from unpaired medical images and text.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Medclip: Contrastive learning from unpaired medical images and text

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.551891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.551891Z digest=sha256:183d6caf73af3cd568524489a8a68691e14c47b623a2362359b1f8bf5a9c0115

Observation 4e6986de-eea2-495a-8b2c-806d73868849 · outbound

This paper cites Med-flamingo: a multimodal medical few-shot learner.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Med-flamingo: a multimodal medical few-shot learner

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.595742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.595742Z digest=sha256:0454c35ed0d20fe408d30991d5c1d21bff88080b643902f69e6a5b1f179ea679

Observation 85dd28e3-1b4b-48c2-b0cc-fa3dfba02acd · outbound

This paper cites RoentGen: Vision-Language Foundation Model for Chest X-ray Generation.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation RoentGen: Vision-Language Foundation Model for Chest X-ray Generation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.705476Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.705476Z digest=sha256:85f15ea5310e2ab91f2e9b9682d3def6c04745d0aa04b5926ddaa2f0b26d373b

Observation b1413c7a-f36c-43d1-a5c8-ca336a0980b3 · outbound

This paper cites MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.772453Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.772453Z digest=sha256:067bb521d1a9960e9a8afadd0e775244d9a24d39d0cb75b8c4a457f366e06c46

Observation a0fc31da-6895-4a4f-88ea-63a1259c9750 · outbound

This paper cites Med3dvlm: An efficient vision- language model for 3d medical image analysis.arXiv preprint arXiv:2503.20047, 2025.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Med3dvlm: An efficient vision- language model for 3d medical image analysis.arXiv preprint arXiv:2503.20047, 2025

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.891354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.891354Z digest=sha256:0561edb9d0f159bbb4d4a8f9763efcc333069dc9d86b8afa7fdd768e4292abfa

Observation c442df6d-789e-46c2-bca6-7ff45989c9c9 · outbound

This paper cites Multilingual diversity improves vision- language representations.Advances in Neural Information Processing Systems, 37:91430– 91459, 2024.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Multilingual diversity improves vision- language representations.Advances in Neural Information Processing Systems, 37:91430– 91459, 2024

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:49.986419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:49.986419Z digest=sha256:265fc29796ec16ca22019dc94671ed4ff93cf1f811fa6ebb47fb3c6ace6de88c

Observation 18334fab-adaa-4e67-9aff-372975113697 · outbound

This paper cites Pmc-clip: Contrastive language-image pre-training using biomedical documents.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Pmc-clip: Contrastive language-image pre-training using biomedical documents

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.045334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.045334Z digest=sha256:3c308a2fa756e8d585b3a799ac75d8a1d05977089fb2e7a98d7dcd6b784b6fc0

Observation 4b85ecaa-be59-44cf-bb2d-bb6df9cd8ff2 · outbound

This paper cites Seco de Herrera, et al.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Seco de Herrera, et al

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.126320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.126320Z digest=sha256:a05e991601944934c1a19b7249340e8cde69cea74db3294303e67cd8af561f91

Observation c7902c83-2a7b-46ba-99f8-da38888a9e3d · outbound

This paper cites Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports.Scientific data, 6(1):317, 2019.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports.Scientific data, 6(1):317, 2019

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.211030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.211030Z digest=sha256:9524b6d8edfab9166a6896fe62795f8ae707083943b695c72259724093a0e24f

Observation 88e70a57-52ba-48ac-bc9b-25f114602eac · outbound

This paper cites Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.300492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.300492Z digest=sha256:9ddc87cc55851a5219a866fb5dd365df8f320404a6daf28f7b24408d8b6d7fe4

Observation 005877fd-9168-4760-b693-704595f14130 · outbound

This paper cites M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.397726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.397726Z digest=sha256:76a33c6c660878a6b6def4c341a2cdbeb4a75cfbab1ffa64a749b24f5d8c5f38

Observation 36a86d23-7f8c-4bb4-907d-9bc1d34f3e9e · outbound

This paper cites Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data, 2023.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data, 2023

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.482833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.482833Z digest=sha256:34023724ce0cc1b73c6627cebef4452268524dae9235bb2cf99278d81bff587f

Observation 9cf15736-4a50-4bc5-8137-9d00c43c5fc5 · outbound

This paper cites Non-invasive metabolic imaging of brain tumours in the era of precision medicine.Nature Reviews Clinical Oncology, 13(12):725–739, 2016.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Non-invasive metabolic imaging of brain tumours in the era of precision medicine.Nature Reviews Clinical Oncology, 13(12):725–739, 2016

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.650593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.650593Z digest=sha256:e85442b8626ee5e80656be21171c8433bacb9b952994eeb53f43c9746fe8cf5c

Observation 0f299304-f5e6-4c8b-8298-b7550748dc3c · outbound

This paper cites Imaging tumor metabolism using positron emission tomography.The Cancer Journal, 21(2):129–136, 2015.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Imaging tumor metabolism using positron emission tomography.The Cancer Journal, 21(2):129–136, 2015

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.777568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.777568Z digest=sha256:c7abfb2f3643b5220feffe40b1ba24427862e34336fc1272ac40603c03b838cc

Observation 3f8b228b-93f7-4833-9b06-4bde5912eb5f · outbound

This paper cites Molecular imaging of cancer with positron emission tomography.Nature Reviews Cancer, 2(9):683–693, 2002.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Molecular imaging of cancer with positron emission tomography.Nature Reviews Cancer, 2(9):683–693, 2002

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:50.916063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:50.916063Z digest=sha256:9e0c6429ca735ce2286900a16dfeab174fc4575414e31289d7307431cfe00017

Observation 1122f41c-1fa8-4aaf-b280-e0dfd64cd8d6 · outbound

This paper cites Advances in pet imaging of cancer.Nature Reviews Cancer, 23(7):474–490, 2023.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Advances in pet imaging of cancer.Nature Reviews Cancer, 23(7):474–490, 2023

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.020369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.020369Z digest=sha256:a90e5feb5e7d9f3e2229c91051852a0640057d8a6c5a6433e0bd2498fe9b500d

Observation e181d1dc-1e47-4658-a664-a7bc8376dd6c · outbound

This paper cites Is long–axial-field-of-view pet/ct cost-effective? an international health–economic analysis.Journal of Nuclear Medicine, 2025.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Is long–axial-field-of-view pet/ct cost-effective? an international health–economic analysis.Journal of Nuclear Medicine, 2025

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.272598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.272598Z digest=sha256:f206bd476a24fb1f76fd9c9306d8559facf842f6a8a019417adc6b06f220a71d

Observation f6b76209-7096-4c2c-86d4-5fe836cc55cc · outbound

This paper cites an unresolved cited work.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Unresolved cited work

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.448785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.448785Z digest=sha256:9fd622d4d4fee75b0164a811299a35f3b7ad046e5e802e188067864ff73a9cfd

Observation 64c66f8e-be10-4cb4-99d1-c5bf601d4a94 · outbound

This paper cites Explore the world population through data (2025).

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Explore the world population through data (2025)

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.562716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.562716Z digest=sha256:24456824c969aef0784c7f22da6665eab61d769183b3fe12332009d082d52619

Observation 475aefb7-a89e-495f-bbcf-2cac80d95a13 · outbound

This paper cites CT2REP: Automated radiology report generation for 3d medical imaging.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation CT2REP: Automated radiology report generation for 3d medical imaging

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.650803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.650803Z digest=sha256:c0b9409ff61f48a63ac85f3be85c7a576c18510ac938f98ed468e72f3dfc1630

Observation 15f7bdbf-f2d6-4332-976c-ce64eaffdaf7 · outbound

This paper cites Rider lung pet-ct: Data for quantitative imaging biomarker evaluation.The Cancer Imaging Archive, 2015.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Rider lung pet-ct: Data for quantitative imaging biomarker evaluation.The Cancer Imaging Archive, 2015

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.714741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.714741Z digest=sha256:cd3ce07f0ecdfcb99ea9b1600bc3a585ceaeac692033a3b9f2c28132f497d09c

Observation 3b87299c-f0de-461a-94bc-863c79f49393 · outbound

This paper cites Data from head- neck-pet-ct.The Cancer Imaging Archive, 2017.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Data from head- neck-pet-ct.The Cancer Imaging Archive, 2017

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.786729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.786729Z digest=sha256:1da820a5ee760dd74c7325129193052c4de32d0be84c581b02dcef03fee953cd

Observation cde17d63-39c9-4d82-badf-1ff3c90abc0c · outbound

This paper cites an unresolved cited work.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.864558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.864558Z digest=sha256:0a7629e10648964cfa3169ae23bb35e497e6408017f6b2df08a37290d1ca039a

Observation 87d322d3-9f80-48bb-bb11-cce0f9671fa7 · outbound

This paper cites Gatidis and T.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Gatidis and T

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:51.928816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:51.928816Z digest=sha256:3f162f1873dcc0504d31781e70b3f67c919cb1dfe3ed16ab4fc20e3b6edd4a8e

Observation 3e19faa5-34bc-4f33-81a2-124881c66971 · outbound

This paper cites Generatect: Text-conditional generation of 3d chest ct volumes.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Generatect: Text-conditional generation of 3d chest ct volumes

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.015749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.015749Z digest=sha256:32135102389fe1e88904e72b6ecc723fe9d79c4b3fbd0e830d8cf4bc4ad4330c

Observation 64df5fca-a99b-4165-9c84-2164f926d364 · outbound

This paper cites Cosmos World Foundation Model Platform for Physical AI.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Cosmos World Foundation Model Platform for Physical AI

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.135555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.135555Z digest=sha256:84d84a31dbb2fb21f8723f54a7b86570409ace581225deeb422d2d5fe04f03f5

Observation 50fa32d3-945b-43a1-bbe2-a512413f7f5d · outbound

This paper cites Mistral 7B.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Mistral 7B

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.325381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.325381Z digest=sha256:aaaad94f81388b6d1403e3f1937202227492dd82496c790baabf835ee8870963

Observation d855019b-a106-4f26-a2d6-2a32817149a3 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.470968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.470968Z digest=sha256:ab800f72ea4b0bc95f9b01fe339cf261e735a33d23bc420310022a963de3461b

Observation 73213cbd-86a7-4d71-892f-b038d84dfb7a · outbound

This paper cites Lora: Low-rank adaptation of large language models.Interna- tional Conference on Learning Representations, 1(2):3, 2022.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Lora: Low-rank adaptation of large language models.Interna- tional Conference on Learning Representations, 1(2):3, 2022

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.647355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.647355Z digest=sha256:fae1714ae58ae7262b8eb0e91c438d6baa6f93ac4c8725c63c22720535b2e5d1

Observation 7215a63d-8b90-46cc-834a-abfa60c5a884 · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Bleu: a method for automatic evaluation of machine translation

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.824012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.824012Z digest=sha256:7224bf56dd7872f9519288152036e31adacb85c8fdd8fe0170a2fee8c3f8f77d

Observation e37df004-5bce-42ce-92b1-afccf6e12338 · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Rouge: A package for automatic evaluation of summaries

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:52.968985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:52.968985Z digest=sha256:0acff62332ed8e172191586e04d075a8dbcba0a852c8dc88f86bca8f117aec00

Observation 0aad0652-d82f-4158-949f-c1788ffba955 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation BERTScore: Evaluating Text Generation with BERT

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.133953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.133953Z digest=sha256:5bfed3dc3b7419ec6df8832f8eddbc385434ce4b9dec3ae91217c80b8d099183

Observation a9799646-c94f-4d82-9ae4-c93ab0c732ee · outbound

This paper cites Plip: Language-image pre-training for person representation learning.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Plip: Language-image pre-training for person representation learning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.190979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.190979Z digest=sha256:1d103e269c691d20f333fa18bee8735211574ca5e9853a8bce97b846ae06175c

Observation 41a1d28b-75b9-412d-b02b-3ec5c383aa7b · outbound

This paper cites BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.282136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.282136Z digest=sha256:9f2b89fe741a359b1fe3f26c1fefdbd46ba21bdf13619fbb36f1e54317d6b5aa

Observation b482b16b-c070-4ea7-84e6-ca0ac2150c1f · outbound

This paper cites Merlin: A vision language foundation model for 3d computed tomography.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Merlin: A vision language foundation model for 3d computed tomography

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.393752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.393752Z digest=sha256:db1cb83da474ae488c09b92b27f1fcb5bb6fafb40309dc87216972d096c561ba

Observation 520a332a-8adc-407a-ad9d-e86f78878044 · outbound

This paper cites Xraygpt: Chest radiographs summarization using large medical vision-language models.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Xraygpt: Chest radiographs summarization using large medical vision-language models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.458624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.458624Z digest=sha256:0db1da0fb6f1130d3b9cc009df982a487c2d1e9baa5a187d02e44b4b9d1434b5

Observation 5386c739-38af-47a9-a519-9028751303d8 · outbound

This paper cites ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.534938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.534938Z digest=sha256:596db6dc1e145ac1a7e7333358e9f160e988a5a0895884ed1d23d3b826c2d237

Observation 578fea1f-7a86-4cf2-a4d7-c3b22b82479a · outbound

This paper cites A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.644209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.644209Z digest=sha256:f0da025518004b6981a7d7edbb74a7b56838a1284ccbb803a2bf791cd96067ae

Observation fcc59d64-6467-4e9e-9d72-b9624dd08203 · outbound

This paper cites Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General Healthcare.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General Healthcare

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.736497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.736497Z digest=sha256:c5f85ca1ac2d39f19b4d6464a5c73edd09da4ec6075e7c0b1b88a996e5ac107f

Observation b647c1b8-b3c1-4f09-8864-086cd347f6e7 · outbound

This paper cites HuatuoGPT, towards Taming Language Model to Be a Doctor.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation HuatuoGPT, towards Taming Language Model to Be a Doctor

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.799423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.799423Z digest=sha256:d678f7610cf6d134248a5d16f4fd52f326998228a73e73a74a5a7d254566debc

Observation d7a9ca04-ffc3-4ee9-91e4-3f35dc20c372 · outbound

This paper cites Decoupled Weight Decay Regularization.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Decoupled Weight Decay Regularization

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:53.916391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:53.916391Z digest=sha256:fdb5b3844406d41d5c25ec9e52bebc7087803d4aafa042cb4cef3f50fd99eeb6

Observation d607da86-543d-4d29-a939-b27082ab8a16 · outbound

This paper cites PhoBERT: Pre-trained language models for Vietnamese.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation PhoBERT: Pre-trained language models for Vietnamese

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:54.048912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:54.048912Z digest=sha256:c3dcd405d8befcf5a15d47902cbedc17e3a2eefa09eb21bd96f94a35231a285b

Observation b7687b65-f2ac-4e8d-8d9e-c8ea480435b3 · outbound

This paper cites SGDR: Stochastic Gradient Descent with Warm Restarts.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation SGDR: Stochastic Gradient Descent with Warm Restarts

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:54.161377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:54.161377Z digest=sha256:6ab406ab83f79d4e6dd87faa5f306387dfaeb11ce34b1416c8209133e1009e0a

Observation bc9fe7bc-d08f-4882-ba2b-5e27dd3bfe2f · outbound

This paper cites Limitations.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation Limitations

Reference 61

Resolution
malformed identifier
no resolver link, observed 2026-08-04T13:51:54.357951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:54.357951Z digest=sha256:9545b687e82a34a6ba39d365826756d17e746ccf3d8663e22561a4b5f47fc4de

Observation 1dc07484-9bd2-4d9b-acbc-41a1e9a49c4f · outbound

This paper cites role":"system.

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation role":"system

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-04T13:51:54.495267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:51:54.495267Z digest=sha256:b89dc1d4a85044fce42774abf87eeb6b79b348f24ff325a7311b525291c32234

Pith citing papers

Observation effde7a5-0394-4b52-bd07-092c0698a0f5 · inbound

MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows cites this paper.

MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-23T01:23:29.085618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-15T00:07:22.106337Z digest=sha256:3fe947caea8a246495713c6f70d96845f21967cf41fde798afaf7d9f2691d1f8

Observation 057ac593-a332-4300-9cb0-7e680028a5ef · inbound

Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced Framework cites this paper.

Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced Framework Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-07-23T01:23:29.085618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-10T05:34:30.894093Z digest=sha256:6d32d3729f1bbfb0b7b1fab784f8af557a7df549ddd6ac5337e348c5b884e5de