{"as_of":"2026-08-18T19:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29c3315b2fda08f1895eb059020650418d35004f4a485a425f1607f61046b2d5","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:51:54.495267Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T00:07:22.106337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:08:21.640745Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"cited_work":{"arxiv_id":"2509.24739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24739","snapshot_observed_at":"2026-07-23T01:23:29.085618Z","title":"Toward a vision-language foundation model for medical data: Multimodal dataset and benchmarks for vietnamese pet/ct report generation","venue":null,"work_id":"2895bcb9-fbde-4d5b-90b7-4f02b3aa25b3","year":2025},"citing_paper":{"arxiv_id":"2603.24649","last_updated":"2026-05-13T17:28:23Z","snapshot_observed_at":"2026-08-11T17:06:10.014756Z","submitted_at":"2026-03-25T17:33:58Z","title":"MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T00:07:22.106337Z"},"links":{"cited_paper":"/paper/2509.24739","citing_paper":"/paper/2603.24649"},"observation_digest":"sha256:3fe947caea8a246495713c6f70d96845f21967cf41fde798afaf7d9f2691d1f8","observation_id":"effde7a5-0394-4b52-bd07-092c0698a0f5","resolution":{"observed_at":"2026-07-23T01:23:29.085618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"cited_work":{"arxiv_id":"2509.24739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24739","snapshot_observed_at":"2026-07-23T01:23:29.085618Z","title":"Toward a vision-language foundation model for medical data: Multimodal dataset and benchmarks for vietnamese pet/ct report generation","venue":null,"work_id":"2895bcb9-fbde-4d5b-90b7-4f02b3aa25b3","year":2025},"citing_paper":{"arxiv_id":"2604.18145","last_updated":"2026-05-15T16:50:04Z","snapshot_observed_at":"2026-08-12T12:23:09.913205Z","submitted_at":"2026-04-20T12:08:21Z","title":"Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced Framework","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T05:34:30.894093Z"},"links":{"cited_paper":"/paper/2509.24739","citing_paper":"/paper/2604.18145"},"observation_digest":"sha256:6d32d3729f1bbfb0b7b1fab784f8af557a7df549ddd6ac5337e348c5b884e5de","observation_id":"057ac593-a332-4300-9cb0-7e680028a5ef","resolution":{"observed_at":"2026-07-23T01:23:29.085618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.24739/citation-record","integrity":"/paper/2509.24739/integrity","json":"/paper/2509.24739/citation-record.json","paper":"/paper/2509.24739"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:47.702634Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.702634Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:02dfc8121067d0692ecf3caa32ad524def38a69e2f0725c3e28d79deb829bb8f","observation_id":"8c38370a-a958-4da9-828c-af74605bbfd4","resolution":{"observed_at":"2026-08-04T13:51:47.702634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-04T13:51:47.766115Z","title":"The dawn of LMMs: Preliminary explorations with GPT-4V(ision).arXiv preprint arXiv:2309.17421, pages 1–166, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.766115Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:a850c4b29b608ffe52a829f21772b28e6a940525a203736f0159468c20587994","observation_id":"efb95acd-2f58-48cd-8702-e49a2bb1e588","resolution":{"observed_at":"2026-08-04T13:51:47.766115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:47.874286Z","title":"Claude: An AI Assistant by Anthropic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.874286Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:f84e1f203a064f496aa134f1a59f633950b399c8cb7f851b4b142b92fa8dc1fa","observation_id":"dd9c7bff-10de-48d8-a2b2-4c04ceb2d500","resolution":{"observed_at":"2026-08-04T13:51:47.874286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T13:51:48.000430Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.000430Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9ccd3dec9c7c8e8ea871a7f7beb2414c651512c4e067fcaf545c73d4b7474f99","observation_id":"d0eae354-ee4b-49aa-8711-dc836fee1360","resolution":{"observed_at":"2026-08-04T13:51:48.000430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T13:51:48.130952Z","title":"Qwen2.5-VL technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.130952Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:b2b838a7bd2d504ef98ef98f07bb7493cb741e7ec1caf1dd65486b270a327b28","observation_id":"533063d2-2515-4d9d-85bb-ef3c8313dfa8","resolution":{"observed_at":"2026-08-04T13:51:48.130952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T13:51:48.230261Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.230261Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:4828affc40b12f34a3da50afbdb9c178616e9b92115969f34362e6e57b21b2ed","observation_id":"6310f6eb-de84-4450-b8d4-4bb7ccd2ca31","resolution":{"observed_at":"2026-08-04T13:51:48.230261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:48.335271Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.335271Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:5b342a40dc599834bb24cca7404f49808f2d287d47976c1beae53bf7ad89931e","observation_id":"5fe60ef1-8e35-4ab6-bd26-5a8499bf9709","resolution":{"observed_at":"2026-08-04T13:51:48.335271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:48.415732Z","title":"Ahive: Anatomy-aware hierarchical vision encoding for interactive radiology report retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.415732Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:5d4f539f2554c143c6e6f3762b27fa501240506e8b6a33681c16b716d2eca576","observation_id":"830e177a-9c4c-4966-b5da-c71b8159654e","resolution":{"observed_at":"2026-08-04T13:51:48.415732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:48.541080Z","title":"Fg-cxr: A radiologist-aligned gaze dataset for enhancing interpretability in chest x-ray report generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.541080Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:544a7297ad8ffa9caedc56ee4e1cfe1471cdba73cdd1eb560ad0998838a14000","observation_id":"9a581a32-c0f5-425e-a0d9-8bbfc81a0fd9","resolution":{"observed_at":"2026-08-04T13:51:48.541080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:48.724997Z","title":"Cplip: zero-shot learning for histopathology with comprehensive vision-language alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.724997Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:514b80a050d4e93cbc768f7476856c44909ffaca0f9139d13817f55d6cf6286a","observation_id":"aed398f9-5b2c-4c37-989c-02e378429813","resolution":{"observed_at":"2026-08-04T13:51:48.724997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-04T13:51:48.855655Z","title":"Flamingo: a visual language model for few-shot learning.arXiv preprint arXiv:2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.855655Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:ad847129f28dedbbc194dc5ba24bf8009432ff3542a3b736d50d4e596d01151e","observation_id":"6792aaef-5272-4ac6-8c45-0e485246dc4a","resolution":{"observed_at":"2026-08-04T13:51:48.855655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.029921Z","title":"Gpt-4o: Openai’s multimodal model with vision, audio, and text capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.029921Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9bc38b2e3e1b9f7abe6cf21c760de1bfe595fff3edee92f52f1b8ea816669bfa","observation_id":"6f175081-8ad3-4922-b66d-5c9dc9c64799","resolution":{"observed_at":"2026-08-04T13:51:49.029921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-16T14:39:48.082697Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-04T13:51:49.123850Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine.arXiv preprint arXiv:2311.16452, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.123850Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:33abd87ca2e4db8f2b7dbbcbdfbfe762a40ecb29d78b6b81805e68ae5d24e299","observation_id":"acac3c1a-a841-4656-8c0a-1cf74bfbb339","resolution":{"observed_at":"2026-08-04T13:51:49.123850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.216358Z","title":"Multi- modal understanding and generation for medical images and text via vision-language pre- training.IEEE Journal of Biomedical and Health Informatics, 26(12):6070–6080, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.216358Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:086b767c6a0e447473274138074ce73722773b181c34f310faaba32ca35a2a11","observation_id":"248a8d75-52d5-4b6c-ad29-bf398559b881","resolution":{"observed_at":"2026-08-04T13:51:49.216358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.301934Z","title":"Towards a better understanding of annotation tools for medical imaging: a survey.Multimedia Tools and Applications, 81(18):25877–25911, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.301934Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9b55c09d2246b66fb175c96d8c1cf178392cf056103f10223b9bd2811d01ef90","observation_id":"3809e221-798a-4ebc-af65-d37677ed2582","resolution":{"observed_at":"2026-08-04T13:51:49.301934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01711","last_updated":"2025-05-03T06:18:12Z","snapshot_observed_at":"2026-08-16T04:09:46.542349Z","submitted_at":"2025-05-03T06:18:12Z","title":"Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01711","snapshot_observed_at":"2026-08-04T13:51:49.388029Z","title":"Knowledge-augmented language models interpreting structured chest x-ray findings.arXiv preprint arXiv:2505.01711, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.388029Z"},"links":{"cited_paper":"/paper/2505.01711","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:686e3f4d712c4c4d4caaf9884c159c6a7cc3abb89355b92e483812c6967c166f","observation_id":"e55a3f84-04a3-4e81-a9c1-651fc387b386","resolution":{"observed_at":"2026-08-04T13:51:49.388029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.468001Z","title":"Knowledge matters: Chest radiology report generation with general and specific knowledge.Medical Image Analysis, 80: 102510, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.468001Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:39bcfc3a2cdc831d4be8cb8e0d002fd0b45dacf2ef8487dfb184585fe47b0017","observation_id":"e07c0a1d-f9f9-4033-89a4-c8800c2bc55d","resolution":{"observed_at":"2026-08-04T13:51:49.468001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.551891Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.551891Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:183d6caf73af3cd568524489a8a68691e14c47b623a2362359b1f8bf5a9c0115","observation_id":"06e71057-9677-4e54-8c96-3ba3f26dddf3","resolution":{"observed_at":"2026-08-04T13:51:49.551891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.595742Z","title":"Med-flamingo: a multimodal medical few-shot learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.595742Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:0454c35ed0d20fe408d30991d5c1d21bff88080b643902f69e6a5b1f179ea679","observation_id":"4e6986de-eea2-495a-8b2c-806d73868849","resolution":{"observed_at":"2026-08-04T13:51:49.595742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12737","last_updated":"2022-11-23T06:58:09Z","snapshot_observed_at":"2026-08-16T16:13:58.976523Z","submitted_at":"2022-11-23T06:58:09Z","title":"RoentGen: Vision-Language Foundation Model for Chest X-ray Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12737","snapshot_observed_at":"2026-08-04T13:51:49.705476Z","title":"Roentgen: vision-language foundation model for chest x-ray generation.arXiv preprint arXiv:2211.12737, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.705476Z"},"links":{"cited_paper":"/paper/2211.12737","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:85f15ea5310e2ab91f2e9b9682d3def6c04745d0aa04b5926ddaa2f0b26d373b","observation_id":"85dd28e3-1b4b-48c2-b0cc-fa3dfba02acd","resolution":{"observed_at":"2026-08-04T13:51:49.705476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19684","last_updated":"2024-09-29T12:23:10Z","snapshot_observed_at":"2026-08-16T13:14:23.748632Z","submitted_at":"2024-09-29T12:23:10Z","title":"MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19684","snapshot_observed_at":"2026-08-04T13:51:49.772453Z","title":"Medvilam: A multi- modal large language model with advanced generalizability and explainability for medical data understanding and generation.arXiv preprint arXiv:2409.19684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.772453Z"},"links":{"cited_paper":"/paper/2409.19684","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:067bb521d1a9960e9a8afadd0e775244d9a24d39d0cb75b8c4a457f366e06c46","observation_id":"b1413c7a-f36c-43d1-a5c8-ca336a0980b3","resolution":{"observed_at":"2026-08-04T13:51:49.772453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.891354Z","title":"Med3dvlm: An efficient vision- language model for 3d medical image analysis.arXiv preprint arXiv:2503.20047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.891354Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:0561edb9d0f159bbb4d4a8f9763efcc333069dc9d86b8afa7fdd768e4292abfa","observation_id":"a0fc31da-6895-4a4f-88ea-63a1259c9750","resolution":{"observed_at":"2026-08-04T13:51:49.891354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:49.986419Z","title":"Multilingual diversity improves vision- language representations.Advances in Neural Information Processing Systems, 37:91430– 91459, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.986419Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:265fc29796ec16ca22019dc94671ed4ff93cf1f811fa6ebb47fb3c6ace6de88c","observation_id":"c442df6d-789e-46c2-bca6-7ff45989c9c9","resolution":{"observed_at":"2026-08-04T13:51:49.986419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.045334Z","title":"Pmc-clip: Contrastive language-image pre-training using biomedical documents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.045334Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:3c308a2fa756e8d585b3a799ac75d8a1d05977089fb2e7a98d7dcd6b784b6fc0","observation_id":"18334fab-adaa-4e67-9aff-372975113697","resolution":{"observed_at":"2026-08-04T13:51:50.045334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.126320Z","title":"Seco de Herrera, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.126320Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:a05e991601944934c1a19b7249340e8cde69cea74db3294303e67cd8af561f91","observation_id":"4b85ecaa-be59-44cf-bb2d-bb6df9cd8ff2","resolution":{"observed_at":"2026-08-04T13:51:50.126320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.211030Z","title":"Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports.Scientific data, 6(1):317, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.211030Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9524b6d8edfab9166a6896fe62795f8ae707083943b695c72259724093a0e24f","observation_id":"c7902c83-2a7b-46ba-99f8-da38888a9e3d","resolution":{"observed_at":"2026-08-04T13:51:50.211030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.300492Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.300492Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9ddc87cc55851a5219a866fb5dd365df8f320404a6daf28f7b24408d8b6d7fe4","observation_id":"88e70a57-52ba-48ac-bc9b-25f114602eac","resolution":{"observed_at":"2026-08-04T13:51:50.300492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-18T17:14:44.330300Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T13:51:50.397726Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.397726Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:76a33c6c660878a6b6def4c341a2cdbeb4a75cfbab1ffa64a749b24f5d8c5f38","observation_id":"005877fd-9168-4760-b693-704595f14130","resolution":{"observed_at":"2026-08-04T13:51:50.397726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.482833Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.482833Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:34023724ce0cc1b73c6627cebef4452268524dae9235bb2cf99278d81bff587f","observation_id":"36a86d23-7f8c-4bb4-907d-9bc1d34f3e9e","resolution":{"observed_at":"2026-08-04T13:51:50.482833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.650593Z","title":"Non-invasive metabolic imaging of brain tumours in the era of precision medicine.Nature Reviews Clinical Oncology, 13(12):725–739, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.650593Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:e85442b8626ee5e80656be21171c8433bacb9b952994eeb53f43c9746fe8cf5c","observation_id":"9cf15736-4a50-4bc5-8137-9d00c43c5fc5","resolution":{"observed_at":"2026-08-04T13:51:50.650593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.777568Z","title":"Imaging tumor metabolism using positron emission tomography.The Cancer Journal, 21(2):129–136, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.777568Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:c7abfb2f3643b5220feffe40b1ba24427862e34336fc1272ac40603c03b838cc","observation_id":"0f299304-f5e6-4c8b-8298-b7550748dc3c","resolution":{"observed_at":"2026-08-04T13:51:50.777568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:50.916063Z","title":"Molecular imaging of cancer with positron emission tomography.Nature Reviews Cancer, 2(9):683–693, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.916063Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9e0c6429ca735ce2286900a16dfeab174fc4575414e31289d7307431cfe00017","observation_id":"3f8b228b-93f7-4833-9b06-4bde5912eb5f","resolution":{"observed_at":"2026-08-04T13:51:50.916063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.020369Z","title":"Advances in pet imaging of cancer.Nature Reviews Cancer, 23(7):474–490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.020369Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:a90e5feb5e7d9f3e2229c91051852a0640057d8a6c5a6433e0bd2498fe9b500d","observation_id":"1122f41c-1fa8-4aaf-b280-e0dfd64cd8d6","resolution":{"observed_at":"2026-08-04T13:51:51.020369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.272598Z","title":"Is long–axial-field-of-view pet/ct cost-effective? an international health–economic analysis.Journal of Nuclear Medicine, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.272598Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:f206bd476a24fb1f76fd9c9306d8559facf842f6a8a019417adc6b06f220a71d","observation_id":"e181d1dc-1e47-4658-a664-a7bc8376dd6c","resolution":{"observed_at":"2026-08-04T13:51:51.272598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.448785Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.448785Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9fd622d4d4fee75b0164a811299a35f3b7ad046e5e802e188067864ff73a9cfd","observation_id":"f6b76209-7096-4c2c-86d4-5fe836cc55cc","resolution":{"observed_at":"2026-08-04T13:51:51.448785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.562716Z","title":"Explore the world population through data (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.562716Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:24456824c969aef0784c7f22da6665eab61d769183b3fe12332009d082d52619","observation_id":"64c66f8e-be10-4cb4-99d1-c5bf601d4a94","resolution":{"observed_at":"2026-08-04T13:51:51.562716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.650803Z","title":"CT2REP: Automated radiology report generation for 3d medical imaging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.650803Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:c0b9409ff61f48a63ac85f3be85c7a576c18510ac938f98ed468e72f3dfc1630","observation_id":"475aefb7-a89e-495f-bbcf-2cac80d95a13","resolution":{"observed_at":"2026-08-04T13:51:51.650803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.714741Z","title":"Rider lung pet-ct: Data for quantitative imaging biomarker evaluation.The Cancer Imaging Archive, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.714741Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:cd3ce07f0ecdfcb99ea9b1600bc3a585ceaeac692033a3b9f2c28132f497d09c","observation_id":"15f7bdbf-f2d6-4332-976c-ce64eaffdaf7","resolution":{"observed_at":"2026-08-04T13:51:51.714741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.786729Z","title":"Data from head- neck-pet-ct.The Cancer Imaging Archive, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.786729Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:1da820a5ee760dd74c7325129193052c4de32d0be84c581b02dcef03fee953cd","observation_id":"3b87299c-f0de-461a-94bc-863c79f49393","resolution":{"observed_at":"2026-08-04T13:51:51.786729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.864558Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.864558Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:0a7629e10648964cfa3169ae23bb35e497e6408017f6b2df08a37290d1ca039a","observation_id":"cde17d63-39c9-4d82-badf-1ff3c90abc0c","resolution":{"observed_at":"2026-08-04T13:51:51.864558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:51.928816Z","title":"Gatidis and T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.928816Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:3f162f1873dcc0504d31781e70b3f67c919cb1dfe3ed16ab4fc20e3b6edd4a8e","observation_id":"87d322d3-9f80-48bb-bb11-cce0f9671fa7","resolution":{"observed_at":"2026-08-04T13:51:51.928816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:52.015749Z","title":"Generatect: Text-conditional generation of 3d chest ct volumes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.015749Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:32135102389fe1e88904e72b6ecc723fe9d79c4b3fbd0e830d8cf4bc4ad4330c","observation_id":"3e19faa5-34bc-4f33-81a2-124881c66971","resolution":{"observed_at":"2026-08-04T13:51:52.015749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-04T13:51:52.135555Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.135555Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:84d84a31dbb2fb21f8723f54a7b86570409ace581225deeb422d2d5fe04f03f5","observation_id":"64df5fca-a99b-4165-9c84-2164f926d364","resolution":{"observed_at":"2026-08-04T13:51:52.135555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-04T13:51:52.325381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.325381Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:aaaad94f81388b6d1403e3f1937202227492dd82496c790baabf835ee8870963","observation_id":"50fa32d3-945b-43a1-bbe2-a512413f7f5d","resolution":{"observed_at":"2026-08-04T13:51:52.325381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T13:51:52.470968Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.470968Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:ab800f72ea4b0bc95f9b01fe339cf261e735a33d23bc420310022a963de3461b","observation_id":"d855019b-a106-4f26-a2d6-2a32817149a3","resolution":{"observed_at":"2026-08-04T13:51:52.470968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:52.647355Z","title":"Lora: Low-rank adaptation of large language models.Interna- tional Conference on Learning Representations, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.647355Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:fae1714ae58ae7262b8eb0e91c438d6baa6f93ac4c8725c63c22720535b2e5d1","observation_id":"73213cbd-86a7-4d71-892f-b038d84dfb7a","resolution":{"observed_at":"2026-08-04T13:51:52.647355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:52.824012Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.824012Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:7224bf56dd7872f9519288152036e31adacb85c8fdd8fe0170a2fee8c3f8f77d","observation_id":"7215a63d-8b90-46cc-834a-abfa60c5a884","resolution":{"observed_at":"2026-08-04T13:51:52.824012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:52.968985Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:52.968985Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:0acff62332ed8e172191586e04d075a8dbcba0a852c8dc88f86bca8f117aec00","observation_id":"e37df004-5bce-42ce-92b1-afccf6e12338","resolution":{"observed_at":"2026-08-04T13:51:52.968985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-04T13:51:53.133953Z","title":"Bertscore: Evaluating text generation with bert.arXiv preprint arXiv:1904.09675, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.133953Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:5bfed3dc3b7419ec6df8832f8eddbc385434ce4b9dec3ae91217c80b8d099183","observation_id":"0aad0652-d82f-4158-949f-c1788ffba955","resolution":{"observed_at":"2026-08-04T13:51:53.133953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:53.190979Z","title":"Plip: Language-image pre-training for person representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.190979Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:1d103e269c691d20f333fa18bee8735211574ca5e9853a8bce97b846ae06175c","observation_id":"a9799646-c94f-4d82-9ae4-c93ab0c732ee","resolution":{"observed_at":"2026-08-04T13:51:53.190979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-08-18T14:56:57.492279Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-04T13:51:53.282136Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.arXiv preprint arXiv:2303.00915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.282136Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9f2b89fe741a359b1fe3f26c1fefdbd46ba21bdf13619fbb36f1e54317d6b5aa","observation_id":"41a1d28b-75b9-412d-b02b-3ec5c383aa7b","resolution":{"observed_at":"2026-08-04T13:51:53.282136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:53.393752Z","title":"Merlin: A vision language foundation model for 3d computed tomography","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.393752Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:db1cb83da474ae488c09b92b27f1fcb5bb6fafb40309dc87216972d096c561ba","observation_id":"b482b16b-c070-4ea7-84e6-ca0ac2150c1f","resolution":{"observed_at":"2026-08-04T13:51:53.393752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:53.458624Z","title":"Xraygpt: Chest radiographs summarization using large medical vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.458624Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:0db1da0fb6f1130d3b9cc009df982a487c2d1e9baa5a187d02e44b4b9d1434b5","observation_id":"520a332a-8adc-407a-ad9d-e86f78878044","resolution":{"observed_at":"2026-08-04T13:51:53.458624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01317","last_updated":"2023-09-07T23:07:51Z","snapshot_observed_at":"2026-08-16T15:11:15.690414Z","submitted_at":"2023-08-02T17:59:45Z","title":"ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01317","snapshot_observed_at":"2026-08-04T13:51:53.534938Z","title":"Elixr: Towards a general purpose x-ray artificial intelligence system through alignment of large language models and radiology vision encoders.arXiv preprint arXiv:2308.01317, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.534938Z"},"links":{"cited_paper":"/paper/2308.01317","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:596db6dc1e145ac1a7e7333358e9f160e988a5a0895884ed1d23d3b826c2d237","observation_id":"5386c739-38af-47a9-a519-9028751303d8","resolution":{"observed_at":"2026-08-04T13:51:53.534938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-16T14:25:27.106074Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-08-04T13:51:53.644209Z","title":"Chexagent: Towards a foundation model for chest x-ray interpretation.arXiv preprint arXiv:2401.12208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.644209Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:f0da025518004b6981a7d7edbb74a7b56838a1284ccbb803a2bf791cd96067ae","observation_id":"578fea1f-7a86-4cf2-a4d7-c3b22b82479a","resolution":{"observed_at":"2026-08-04T13:51:53.644209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17956","last_updated":"2023-11-01T07:10:23Z","snapshot_observed_at":"2026-08-16T14:48:22.025365Z","submitted_at":"2023-10-27T08:05:21Z","title":"Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General Healthcare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17956","snapshot_observed_at":"2026-08-04T13:51:53.736497Z","title":"Qilin- med-vl: Towards chinese large vision-language model for general healthcare.arXiv preprint arXiv:2310.17956, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.736497Z"},"links":{"cited_paper":"/paper/2310.17956","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:c5f85ca1ac2d39f19b4d6464a5c73edd09da4ec6075e7c0b1b88a996e5ac107f","observation_id":"fcc59d64-6467-4e9e-9d72-b9624dd08203","resolution":{"observed_at":"2026-08-04T13:51:53.736497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15075","last_updated":"2023-05-24T11:56:01Z","snapshot_observed_at":"2026-08-18T08:23:21.051891Z","submitted_at":"2023-05-24T11:56:01Z","title":"HuatuoGPT, towards Taming Language Model to Be a Doctor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15075","snapshot_observed_at":"2026-08-04T13:51:53.799423Z","title":"Huatuogpt, towards taming language model to be a doctor.arXiv preprint arXiv:2305.15075, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.799423Z"},"links":{"cited_paper":"/paper/2305.15075","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:d678f7610cf6d134248a5d16f4fd52f326998228a73e73a74a5a7d254566debc","observation_id":"b647c1b8-b3c1-4f09-8864-086cd347f6e7","resolution":{"observed_at":"2026-08-04T13:51:53.799423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T13:51:53.916391Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:53.916391Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:fdb5b3844406d41d5c25ec9e52bebc7087803d4aafa042cb4cef3f50fd99eeb6","observation_id":"d7a9ca04-ffc3-4ee9-91e4-3f35dc20c372","resolution":{"observed_at":"2026-08-04T13:51:53.916391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00744","last_updated":"2020-10-05T09:53:19Z","snapshot_observed_at":"2026-08-15T23:31:01.635797Z","submitted_at":"2020-03-02T10:21:17Z","title":"PhoBERT: Pre-trained language models for Vietnamese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.00744","snapshot_observed_at":"2026-08-04T13:51:54.048912Z","title":"Phobert: Pre-trained language models for vietnamese","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:54.048912Z"},"links":{"cited_paper":"/paper/2003.00744","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:c3dcd405d8befcf5a15d47902cbedc17e3a2eefa09eb21bd96f94a35231a285b","observation_id":"d607da86-543d-4d29-a939-b27082ab8a16","resolution":{"observed_at":"2026-08-04T13:51:54.048912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-04T13:51:54.161377Z","title":"Sgdr: Stochastic gradient descent with warm restarts.arXiv preprint arXiv:1608.03983, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:54.161377Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:6ab406ab83f79d4e6dd87faa5f306387dfaeb11ce34b1416c8209133e1009e0a","observation_id":"b7687b65-f2ac-4e8d-8d9e-c8ea480435b3","resolution":{"observed_at":"2026-08-04T13:51:54.161377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:54.357951Z","title":"Limitations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:54.357951Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9545b687e82a34a6ba39d365826756d17e746ccf3d8663e22561a4b5f47fc4de","observation_id":"bc9fe7bc-d08f-4882-ba2b-5e27dd3bfe2f","resolution":{"observed_at":"2026-08-04T13:51:54.357951Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:54.495267Z","title":"role\":\"system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:54.495267Z"},"links":{"citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:b89dc1d4a85044fce42774abf87eeb6b79b348f24ff325a7311b525291c32234","observation_id":"1dc07484-9bd2-4d9b-acbc-41a1e9a49c4f","resolution":{"observed_at":"2026-08-04T13:51:54.495267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T14:24:47.270645Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2509.24739."}