{"as_of":"2026-08-14T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5934fc4d3b4319748741a836c26a1139c1538ea331a562398efdb48e0ecb100c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:35:05.706759Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-12T17:18:04.172031Z","title":"arXiv preprint arXiv:2406.19280 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12713","last_updated":"2024-11-19T18:27:31Z","snapshot_observed_at":"2026-08-12T21:18:54.878062Z","submitted_at":"2024-11-19T18:27:31Z","title":"CATCH: Complementary Adaptive Token-level Contrastive Decoding to Mitigate Hallucinations in LVLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:04.172031Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2411.12713"},"observation_digest":"sha256:1c70c1bdff8bd4a9ab1aecd57f26e14fdfcd3910a0b22a291cfd2fbd16f5651c","observation_id":"7253cf51-f030-4c56-8842-6578b2a220e6","resolution":{"observed_at":"2026-08-12T17:18:04.172031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-12T15:16:27.649840Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-14T07:37:08.643528Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.649840Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:61d68700616b53a98a0c825c0ffd2cf3e4f93dc0c23da9f5e2eb96f82ed0a935","observation_id":"00198be9-9255-40dc-a781-d94e84bcdfb4","resolution":{"observed_at":"2026-08-12T15:16:27.649840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-12T05:56:46.703498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19930","last_updated":"2025-08-27T15:21:58Z","snapshot_observed_at":"2026-08-14T03:10:37.344096Z","submitted_at":"2024-11-29T18:42:28Z","title":"On Domain-Adaptive Post-Training for Multimodal Large Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T05:56:46.703498Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2411.19930"},"observation_digest":"sha256:cc1a30d1ac7c8526a6fa58d03f2a6742bb0d4dd2f3e4326111eeed4e5730a42b","observation_id":"83739f70-003d-43dd-b32d-3b705eb7fe2a","resolution":{"observed_at":"2026-08-12T05:56:46.703498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T12:36:50.060335Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2412.18925"},"observation_digest":"sha256:b24c051c171b4da8af7f20f0428986f74a0ee4224ba769107065451bd597be00","observation_id":"6ee5fc8a-b11a-4c47-9a5f-491b582c54de","resolution":{"observed_at":"2026-05-15T12:36:50.113768Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-10T23:40:44.727179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20070","last_updated":"2025-05-31T11:45:12Z","snapshot_observed_at":"2026-08-14T20:00:58.787081Z","submitted_at":"2024-12-28T07:50:00Z","title":"Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T23:40:44.727179Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2412.20070"},"observation_digest":"sha256:8c7f6493bd4edab338ee33d35ec3f60150db754acd62a21089dc430590b1dd21","observation_id":"895d79ea-704a-479e-8948-f89c959c7064","resolution":{"observed_at":"2026-08-10T23:40:44.727179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-10T18:24:41.782690Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11347","last_updated":"2025-03-15T02:35:48Z","snapshot_observed_at":"2026-08-14T18:20:08.438957Z","submitted_at":"2025-01-20T09:12:06Z","title":"EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:24:41.782690Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2501.11347"},"observation_digest":"sha256:52d679f9471bd9187f386680e35ef258098b5411a07bed7db95ccd447c5ba34a","observation_id":"57ecf7b4-5a5b-4cef-a5ad-e309afef81f9","resolution":{"observed_at":"2026-08-10T18:24:41.782690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T22:13:31.837086Z","title":"arXiv preprint arXiv:2406.19280 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09242","last_updated":"2025-02-13T11:57:51Z","snapshot_observed_at":"2026-08-14T01:30:33.206577Z","submitted_at":"2025-02-13T11:57:51Z","title":"From large language models to multimodal AI: A scoping review on the potential of generative AI in medicine","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-08-07T22:13:31.837086Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2502.09242"},"observation_digest":"sha256:e28d7d58b0b4f8947426126e9436b789c638f4f204585a772dd708d91ea63dd2","observation_id":"d4e072af-8f2f-42b8-90f8-3d6f18fed410","resolution":{"observed_at":"2026-08-07T22:13:31.837086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T20:21:30.364189Z","title":"H.; Wang, X.; Zhang, R.; Cai, Z.; Ji, K.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09838","last_updated":"2025-02-21T17:39:29Z","snapshot_observed_at":"2026-08-14T04:57:56.034309Z","submitted_at":"2025-02-14T00:42:36Z","title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T20:21:30.364189Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2502.09838"},"observation_digest":"sha256:4c09cc10e164e7b33efb3c2530d0835598ff4e3816afa2372df4d2222e451bfd","observation_id":"7815ca95-f077-402d-8f31-5a207dc26b80","resolution":{"observed_at":"2026-08-07T20:21:30.364189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T14:33:44.809561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18503","last_updated":"2025-05-24T04:45:45Z","snapshot_observed_at":"2026-08-14T04:54:12.332218Z","submitted_at":"2025-05-24T04:45:45Z","title":"Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:33:44.809561Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2505.18503"},"observation_digest":"sha256:c62c02b36ece5197200d886fa9cf1bebce1f17ffa77b84a33e2d9dc8a6576aa3","observation_id":"3e925468-2865-475f-a3e4-b7789c589afb","resolution":{"observed_at":"2026-08-07T14:33:44.809561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T14:24:42.360661Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-14T13:57:52.410892Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.360661Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:e4368e3c5765f81e66956b677827d098d595d23b6135e0240235c12498f9252f","observation_id":"4984e00a-9b04-4f94-9a48-9fc79a1f61ca","resolution":{"observed_at":"2026-08-07T14:24:42.360661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T12:57:02.678990Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23143","last_updated":"2025-05-29T06:30:40Z","snapshot_observed_at":"2026-08-13T03:26:42.961336Z","submitted_at":"2025-05-29T06:30:40Z","title":"Interpreting Chest X-rays Like a Radiologist: A Benchmark with Clinical Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:57:02.678990Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2505.23143"},"observation_digest":"sha256:86c19f4b5f7bdce2b9cb805836d383de5ab7eca5278adec98a2f8e697bbcb648","observation_id":"1acf071c-13bb-4a89-b1a7-1a3f015cf456","resolution":{"observed_at":"2026-08-07T12:57:02.678990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T12:35:06.182529Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24173","last_updated":"2025-05-30T03:33:25Z","snapshot_observed_at":"2026-08-13T15:17:20.785954Z","submitted_at":"2025-05-30T03:33:25Z","title":"DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:06.182529Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2505.24173"},"observation_digest":"sha256:32248c1ce6fe9c9042c14b031044fc88d9cfda64d7975bc83dd6034a860d8e31","observation_id":"dd08d31e-90e7-4d0c-8dd7-fb5aee4c4f6b","resolution":{"observed_at":"2026-08-07T12:35:06.182529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T12:01:02.852643Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00855","last_updated":"2025-06-01T06:28:36Z","snapshot_observed_at":"2026-08-13T06:47:35.198089Z","submitted_at":"2025-06-01T06:28:36Z","title":"MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:02.852643Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.00855"},"observation_digest":"sha256:ab30cafe8ca0043cef954cefd95b62f39d1ccbb2c17d647054d28380ea1f6978","observation_id":"c4e31152-36ae-4729-892b-c3b61923bd92","resolution":{"observed_at":"2026-08-07T12:01:02.852643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T11:31:48.640705Z","title":"Huatuogpt-vision, to- wards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02327","last_updated":"2025-06-02T23:50:40Z","snapshot_observed_at":"2026-08-13T05:41:29.683076Z","submitted_at":"2025-06-02T23:50:40Z","title":"Medical World Model: Generative Simulation of Tumor Evolution for Treatment Planning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:48.640705Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.02327"},"observation_digest":"sha256:d5852f22e4d7290754b799d36c6c70ab5db0737cb4fc1e9296ef8eaf2d9071c1","observation_id":"733d3356-3db0-49f4-99cc-eae4d693064b","resolution":{"observed_at":"2026-08-07T11:31:48.640705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2506.05831","last_updated":"2026-04-07T10:06:53Z","snapshot_observed_at":"2026-08-11T06:23:45.741698Z","submitted_at":"2025-06-06T07:56:41Z","title":"HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T10:44:01.880405Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.05831"},"observation_digest":"sha256:3b3b9462b2befddc0abac33de9c1330c73b07806053c25f4a588214a67ebc661","observation_id":"c8d9a6ba-42ad-4486-958d-4bf2f8dcc8ad","resolution":{"observed_at":"2026-05-19T10:47:15.081327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T05:57:22.717492Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06600","last_updated":"2025-06-14T19:41:30Z","snapshot_observed_at":"2026-08-14T11:49:25.157432Z","submitted_at":"2025-06-07T00:26:23Z","title":"RARL: Improving Medical VLM Reasoning and Generalization with Reinforcement Learning and LoRA under Data and Hardware Constraints","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:57:22.717492Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.06600"},"observation_digest":"sha256:937223203450f5fd2be5a60364c9c08de099f2aa2d038804335098ef40dca71e","observation_id":"a3f3f9be-363b-4006-9834-d829cd011408","resolution":{"observed_at":"2026-08-07T05:57:22.717492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T04:47:07.641054Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.641054Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:59c85599b555d2cdbbe38363acd844f131ec30dc8438f69b2c38bc1a6bb615a7","observation_id":"48dcebf1-4bf3-43a9-822f-079ce5e67f00","resolution":{"observed_at":"2026-08-07T04:47:07.641054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2506.11989","last_updated":"2026-05-01T04:52:44Z","snapshot_observed_at":"2026-07-06T21:41:52.859699Z","submitted_at":"2025-06-13T17:46:14Z","title":"Thought Graph Traversal for Test-time Scaling in Chest X-ray VLLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T09:15:46.135084Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.11989"},"observation_digest":"sha256:7aaa1980a15176756fcbd848a3bd4d5080a85582a651e62b1298fafa443f48fb","observation_id":"8c3e2485-fa62-42fe-9688-a2403bd9e1a3","resolution":{"observed_at":"2026-05-19T09:17:13.932466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T00:40:17.728304Z","title":"arXiv preprint arXiv:2406.19280 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-12T19:46:34.783452Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.728304Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:1c73b73b616c409f2ffa7cb61c8be9ed64f4e04f6e262d7764ebc35638ec7ca6","observation_id":"0ec0d310-c99a-4b0b-81d9-446500bb119c","resolution":{"observed_at":"2026-08-07T00:40:17.728304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T18:55:17.613129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06959","last_updated":"2025-07-09T15:40:18Z","snapshot_observed_at":"2026-08-10T09:02:56.846535Z","submitted_at":"2025-07-09T15:40:18Z","title":"CheXPO: Preference Optimization for Chest X-ray VLMs with Counterfactual Rationale","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:17.613129Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2507.06959"},"observation_digest":"sha256:f92932c116f767d676ba0b0a473e5df15886a5cde67b3f5cc19665c976edb893","observation_id":"5829d0ea-3cdc-4841-8729-a2442c5c2caf","resolution":{"observed_at":"2026-08-06T18:55:17.613129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T18:34:25.360730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07902","last_updated":"2025-07-10T16:33:50Z","snapshot_observed_at":"2026-08-14T01:14:07.831725Z","submitted_at":"2025-07-10T16:33:50Z","title":"MIRA: A Novel Framework for Fusing Modalities in Medical RAG","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:25.360730Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2507.07902"},"observation_digest":"sha256:6d4b12ea04013b38ec9b241fdd3e6a6d9cc4b44a5b621cfe5d52c9c24e4e46da","observation_id":"24cc1d87-4463-494b-9f1d-208e1c2bfc93","resolution":{"observed_at":"2026-08-06T18:34:25.360730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T18:06:23.774162Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09209","last_updated":"2025-07-12T09:03:30Z","snapshot_observed_at":"2026-08-14T15:19:08.265341Z","submitted_at":"2025-07-12T09:03:30Z","title":"Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:06:23.774162Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2507.09209"},"observation_digest":"sha256:1cb3a533141f67ccf9499a63f29824a3f6c96b9714a2ba5ecede33a62dc5d2a8","observation_id":"ef3b3bd9-d951-4494-8e39-26b57aa1de30","resolution":{"observed_at":"2026-08-06T18:06:23.774162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T17:19:46.890585Z","title":"arXiv preprint arXiv:2406.19280 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11200","last_updated":"2025-07-18T16:56:02Z","snapshot_observed_at":"2026-08-13T06:59:18.824907Z","submitted_at":"2025-07-15T11:12:39Z","title":"How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:19:46.890585Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2507.11200"},"observation_digest":"sha256:d601972aa0fc347535dde0f5f8f101d535037497a796dc7bf445bfd2ebb23614","observation_id":"faf3aa55-f2f1-43e7-b1d3-3c55f7592289","resolution":{"observed_at":"2026-08-06T17:19:46.890585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T15:32:34.476129Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-11T23:02:25.619692Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.476129Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:4c58d3eab2637571c3b34d7547310eb63bfad6e2bcea7b702f7a7e719ff89802","observation_id":"4180b87b-fc99-4342-8b17-1fff9bf367cf","resolution":{"observed_at":"2026-08-06T15:32:34.476129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T11:00:49.945470Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03733","last_updated":"2025-07-31T05:07:18Z","snapshot_observed_at":"2026-08-13T17:06:20.279931Z","submitted_at":"2025-07-31T05:07:18Z","title":"CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:00:49.945470Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2508.03733"},"observation_digest":"sha256:ca3d9e501b20f8f8d7c1e8f1dfce5ff9ea2f38fc00313e168bdf6479b154be6b","observation_id":"4e8e76aa-958b-4d80-92ef-d64a3930fd5f","resolution":{"observed_at":"2026-08-06T11:00:49.945470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T23:37:06.417636Z","title":"H.; Wang, X.; Zhang, R.; Cai, Z.; Ji, K.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05083","last_updated":"2025-08-07T07:09:26Z","snapshot_observed_at":"2026-08-10T18:04:54.727985Z","submitted_at":"2025-08-07T07:09:26Z","title":"MedMKEB: A Comprehensive Knowledge Editing Benchmark for Medical Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:37:06.417636Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2508.05083"},"observation_digest":"sha256:63f6655f7b3fbfc157f8c7b3b2d7c4d2a34c3cafb1f4ead5bac3559775d637b3","observation_id":"199e2a0d-04a8-440f-b669-2c3d141aa345","resolution":{"observed_at":"2026-08-05T23:37:06.417636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T16:21:43.094255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18687","last_updated":"2025-08-26T05:21:19Z","snapshot_observed_at":"2026-08-14T21:42:48.015545Z","submitted_at":"2025-08-26T05:21:19Z","title":"Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:21:43.094255Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2508.18687"},"observation_digest":"sha256:c37e4456b3a16f82fe825d9a3958e18def5e30b9c544e566a8f9e38b91aabdf4","observation_id":"654ea1b8-186c-4fda-b34c-6ae2f4e6c556","resolution":{"observed_at":"2026-08-05T16:21:43.094255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-04T19:48:44.653849Z","title":"Available: https://arxiv.org/abs/2406.19280","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09064","last_updated":"2025-09-11T00:12:59Z","snapshot_observed_at":"2026-08-08T21:56:46.677679Z","submitted_at":"2025-09-11T00:12:59Z","title":"Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:44.653849Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2509.09064"},"observation_digest":"sha256:f8c8adcbec8aba9c02c16d05290c016b1d8acc61e33780300a0fc362c79813dc","observation_id":"52eb3776-1329-4adb-8b07-ab4f5dc31559","resolution":{"observed_at":"2026-08-04T19:48:44.653849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-04T19:27:40.611783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09254","last_updated":"2025-09-11T08:39:08Z","snapshot_observed_at":"2026-08-13T12:46:10.993958Z","submitted_at":"2025-09-11T08:39:08Z","title":"Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:40.611783Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2509.09254"},"observation_digest":"sha256:2a8ec3054d1ce84ee280934e6d57802230c4ac0c3fc33992b1dda04e0e36124d","observation_id":"2dd43cdf-efbc-4911-80f6-fd3a22fc74af","resolution":{"observed_at":"2026-08-04T19:27:40.611783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-04T08:14:35.849953Z","title":"Huatuogpt-vision, towards injecting medi- cal visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:35.849953Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:3c05253b1337e602b3be91f54ba70957cc5b177670d9877efcb3d92224512a61","observation_id":"d8977dd1-3c51-4d54-a3fc-f62988cf15b8","resolution":{"observed_at":"2026-08-04T08:14:35.849953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-03T17:52:07.640057Z","title":"Huatuogpt-vision, to- wards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08029","last_updated":"2026-07-06T17:23:11Z","snapshot_observed_at":"2026-08-14T16:18:11.860297Z","submitted_at":"2025-12-08T20:42:10Z","title":"CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:52:07.640057Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2512.08029"},"observation_digest":"sha256:a35aa0305a9fe0629db4ead67eafe8c09b0a69b924b90163e608c9579e6163e9","observation_id":"97cf8811-c31d-467a-8cb8-c73f7373d61d","resolution":{"observed_at":"2026-08-03T17:52:07.640057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2601.03054","last_updated":"2026-04-07T14:46:22Z","snapshot_observed_at":"2026-07-31T17:41:45.462465Z","submitted_at":"2026-01-06T14:37:50Z","title":"IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T17:31:33.903063Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2601.03054"},"observation_digest":"sha256:469a2eb3011505003261a3c5ad6b4db7c699b9b20a036ec9c6798350b89bd8d8","observation_id":"1d3fc894-ee14-4e1f-abd3-91792a3331e9","resolution":{"observed_at":"2026-05-16T17:33:10.132677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-03T10:49:58.923107Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08758","last_updated":"2026-06-29T18:48:00Z","snapshot_observed_at":"2026-08-06T02:33:07.002390Z","submitted_at":"2026-01-13T17:42:27Z","title":"M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T10:49:58.923107Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2601.08758"},"observation_digest":"sha256:84f9f791777c979dcb94ac7814c06236222095b6b2311cb7e8b34701db7ccdde","observation_id":"bf1e47a4-c6ab-47e7-8e2d-53a55127c2ce","resolution":{"observed_at":"2026-08-03T10:49:58.923107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2602.21950","last_updated":"2026-04-17T00:38:13Z","snapshot_observed_at":"2026-08-11T13:36:49.566598Z","submitted_at":"2026-02-25T14:33:33Z","title":"MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T19:34:42.244909Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2602.21950"},"observation_digest":"sha256:be0f764cd53c35d9cae9e93ab4ea3f361ec31ef8e553279f241852eee90b2947","observation_id":"3840de88-751e-4afd-ba85-0b28dc408eba","resolution":{"observed_at":"2026-05-15T19:36:32.807527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-02T18:16:32.110889Z","title":"H., Wang, X., Zhang, R., Cai, Z., Ji, K., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.13800","last_updated":"2026-07-16T07:01:10Z","snapshot_observed_at":"2026-08-08T04:14:58.532695Z","submitted_at":"2026-03-14T07:17:45Z","title":"Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-02T18:16:32.110889Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2603.13800"},"observation_digest":"sha256:12f578a3237eb4dd74fc97d5e722bf5a7c5b0897a64ec8a2f70b63a23faca8f0","observation_id":"ae4fd3de-ae19-4dd5-8777-e9e4ccb2e5c3","resolution":{"observed_at":"2026-08-02T18:16:32.110889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-02T17:47:52.088098Z","title":"arXiv:2406.19280 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.21693","last_updated":"2026-07-17T21:35:47Z","snapshot_observed_at":"2026-08-07T23:09:46.730097Z","submitted_at":"2026-03-23T08:29:53Z","title":"Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T17:47:52.088098Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2603.21693"},"observation_digest":"sha256:c4d958febcabad29bc53cfb6116ba1423bd7954db7106dc10c3d261ab1d03256","observation_id":"7bb6f50f-f719-47b1-b16e-108788089657","resolution":{"observed_at":"2026-08-02T17:47:52.088098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-13T19:53:53.219607Z","title":"Huatuogpt-vision, to- wards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23082","last_updated":"2026-06-05T20:06:49Z","snapshot_observed_at":"2026-08-13T20:44:24.031551Z","submitted_at":"2026-03-24T11:25:52Z","title":"Spatial navigation in preclinical Alzheimer's disease: A review","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T19:53:53.219607Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2603.23082"},"observation_digest":"sha256:1f9d6ee025d863f8cf733a111f1b564335ced66d96c765d1479d152af512da64","observation_id":"5ccaa8e1-d88d-4ae9-a63c-0889fc11bedd","resolution":{"observed_at":"2026-07-13T19:53:53.219607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2603.24649","last_updated":"2026-05-13T17:28:23Z","snapshot_observed_at":"2026-08-11T17:06:10.014756Z","submitted_at":"2026-03-25T17:33:58Z","title":"MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T00:07:22.106337Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2603.24649"},"observation_digest":"sha256:9b696c091b6cd871a9265263efc14b37fb51f8aac2950ff9505b62e5924093f5","observation_id":"d64d33f4-50da-4aa0-9b21-c8c002083005","resolution":{"observed_at":"2026-05-15T00:08:21.666841Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-13T14:28:05.261852Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01313","last_updated":"2026-07-13T21:14:32Z","snapshot_observed_at":"2026-08-05T01:00:36.896864Z","submitted_at":"2026-04-01T18:36:47Z","title":"ScatterPrism: convergence for generative simulation and inverse problems in particle and nuclear physics","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T14:28:05.261852Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.01313"},"observation_digest":"sha256:fa8532915ea9e87955e00d73f1632c944f268b9b8ade0a142129e72178a3be3d","observation_id":"5cd3d405-e309-46e2-9619-58fca984db3e","resolution":{"observed_at":"2026-07-13T14:28:05.261852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-15T11:44:19.622453Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01313","last_updated":"2026-07-13T21:14:32Z","snapshot_observed_at":"2026-08-05T01:00:36.896864Z","submitted_at":"2026-04-01T18:36:47Z","title":"ScatterPrism: convergence for generative simulation and inverse problems in particle and nuclear physics","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T11:44:19.622453Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.01313"},"observation_digest":"sha256:11595b397283d8f1131c44cacf35f4b10352b1430a57ef5f598fe5d3c3b10b7b","observation_id":"197074b1-5345-4f8b-ba8f-d687477009ab","resolution":{"observed_at":"2026-07-15T11:44:19.622453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-13T08:39:01.975337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.07125","last_updated":"2026-06-06T12:46:41Z","snapshot_observed_at":"2026-08-11T17:03:59.463136Z","submitted_at":"2026-04-08T14:19:39Z","title":"Scalable and Private Federated Learning Using Distributed Differential Privacy and Secure Aggregation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T08:39:01.975337Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.07125"},"observation_digest":"sha256:cf205babc07ebd6aeb3fd053057e1c7d3236d26cfca7e3d9a96bb11821177f89","observation_id":"2e54f11e-c003-43d3-b341-021267cad10f","resolution":{"observed_at":"2026-07-13T08:39:01.975337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2604.07128","last_updated":"2026-04-08T14:21:29Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:21:29Z","title":"A Utility-preserving De-identification Pipeline for Cross-hospital Radiology Data Sharing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:54.328413Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.07128"},"observation_digest":"sha256:1bca7ac2bfdba15db963d27c72a466bd9a5c9b69ffe781353ae47a58eac24302","observation_id":"71bbd91b-1bfc-4079-b77c-f93b36c0136b","resolution":{"observed_at":"2026-05-11T05:30:59.599810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2604.13756","last_updated":"2026-04-15T11:41:20Z","snapshot_observed_at":"2026-08-11T19:17:25.905092Z","submitted_at":"2026-04-15T11:41:20Z","title":"MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T12:47:27.551670Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.13756"},"observation_digest":"sha256:51947878f1f797043802fa9e9412ff8dabd150158ff72e4b5ab0fd68254d6a02","observation_id":"b0a2712d-e26a-41ab-8f96-7c6ee7b040d2","resolution":{"observed_at":"2026-05-10T12:50:25.257886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2604.14316","last_updated":"2026-04-15T18:19:05Z","snapshot_observed_at":"2026-08-09T13:58:37.432409Z","submitted_at":"2026-04-15T18:19:05Z","title":"Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T13:14:48.103651Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.14316"},"observation_digest":"sha256:5b5b431d6b016076b262b847a511e9ad6a5636f4d727c9180b0b2785c161bcd7","observation_id":"7cf6206d-be77-4dd4-904f-efc47039eb89","resolution":{"observed_at":"2026-05-10T13:15:26.144571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2604.20350","last_updated":"2026-04-22T08:52:50Z","snapshot_observed_at":"2026-08-11T07:29:36.585895Z","submitted_at":"2026-04-22T08:52:50Z","title":"X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:04:07.511600Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2604.20350"},"observation_digest":"sha256:60f7ac00ec2e3296f3df7fe77782d6a835d650458d651438009663a226036dc8","observation_id":"80d0b41f-bebd-4f55-8c46-89536b31d7e9","resolution":{"observed_at":"2026-05-10T01:04:49.687180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.06537","last_updated":"2026-05-07T16:37:10Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T16:37:10Z","title":"MedHorizon: Towards Long-context Medical Video Understanding in the Wild","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-08T12:28:35.008604Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.06537"},"observation_digest":"sha256:349b81f1a48eac5e0b0d34fd49721644b010eb70697a3aee52fd7e4fc761d42a","observation_id":"2eb0ed3f-43a7-4ef2-a9cb-ba6d34e78ddb","resolution":{"observed_at":"2026-05-11T19:16:07.533998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.09679","last_updated":"2026-05-10T17:57:57Z","snapshot_observed_at":"2026-08-13T08:12:22.920418Z","submitted_at":"2026-05-10T17:57:57Z","title":"DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:02:36.159920Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.09679"},"observation_digest":"sha256:d42b8a27b5644cc379228f09a6d080f51633efe2c983a2bcc64e48688f745e18","observation_id":"1153f00b-9f48-4dbb-92b8-059a49c3dad1","resolution":{"observed_at":"2026-05-12T06:41:43.388149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.10286","last_updated":"2026-05-11T09:46:41Z","snapshot_observed_at":"2026-08-08T02:33:07.217362Z","submitted_at":"2026-05-11T09:46:41Z","title":"AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T05:10:02.941396Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.10286"},"observation_digest":"sha256:dd9e66cb7e181d140a938649846b6116fc9d64b7c26a009d222b84d175801cc1","observation_id":"ca4e5bde-3444-4c15-9ffc-148920d52e5d","resolution":{"observed_at":"2026-05-12T05:11:21.929441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.10286","last_updated":"2026-05-11T09:46:41Z","snapshot_observed_at":"2026-08-08T02:33:07.217362Z","submitted_at":"2026-05-11T09:46:41Z","title":"AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-12T05:10:02.941396Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.10286"},"observation_digest":"sha256:7329d101871f67aefe8d5acc52e983e718ff12b496d8389c907c59def9060386","observation_id":"afc2741f-a9a7-4cdb-a1c9-2a62f8bc5c6a","resolution":{"observed_at":"2026-05-12T05:31:25.823602Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.14403","last_updated":"2026-05-14T05:41:11Z","snapshot_observed_at":"2026-08-13T15:12:42.698362Z","submitted_at":"2026-05-14T05:41:11Z","title":"DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:56:04.280700Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.14403"},"observation_digest":"sha256:942f58f8fa8c7d4b09a0221555a1f950fca33a49126061367197c6b6da00a11c","observation_id":"e2a5b865-88e4-4acf-8623-8df39f8eb0e1","resolution":{"observed_at":"2026-05-15T02:58:33.487014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.15561","last_updated":"2026-05-15T03:07:52Z","snapshot_observed_at":"2026-08-03T03:12:42.220786Z","submitted_at":"2026-05-15T03:07:52Z","title":"RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T19:58:26.380111Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.15561"},"observation_digest":"sha256:2679a8d49364a657e114f01b775861147b4c139c597dc79f904eeb9f3de91099","observation_id":"3614521a-79b0-4132-9ed7-dab180e83428","resolution":{"observed_at":"2026-05-20T19:58:58.612149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.20277","last_updated":"2026-05-19T04:33:27Z","snapshot_observed_at":"2026-08-02T18:32:04.022058Z","submitted_at":"2026-05-19T04:33:27Z","title":"Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-21T08:06:02.176934Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.20277"},"observation_digest":"sha256:94f4b6cddae541727a68bdf88bb970f5b99c5c8eb4085ebd086e05e73b8841cd","observation_id":"45e836c7-ed99-47e1-8601-d894ef2d6b22","resolution":{"observed_at":"2026-05-21T08:09:51.696719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-13T00:11:26.451809Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27378","last_updated":"2026-04-09T06:37:11Z","snapshot_observed_at":"2026-08-13T05:03:29.060948Z","submitted_at":"2026-04-09T06:37:11Z","title":"OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T00:11:26.451809Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.27378"},"observation_digest":"sha256:f502ff52de6af37dc3f229184eaa588210fa66f492284c7e3d35680d71aac54e","observation_id":"a9c5687e-b22a-46d2-b86c-2367cd35690e","resolution":{"observed_at":"2026-07-13T00:11:26.451809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2605.28422","last_updated":"2026-05-27T12:53:13Z","snapshot_observed_at":"2026-08-12T18:59:05.650362Z","submitted_at":"2026-05-27T12:53:13Z","title":"VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:10:36.266366Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2605.28422"},"observation_digest":"sha256:dc18818e5c1bfac6f9a1b828095f03b4860e4330878683bc545ecf97bdc73885","observation_id":"98bb59a0-8e3c-4f1c-8873-e1da9ad1562c","resolution":{"observed_at":"2026-06-29T13:13:27.291018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.00602","last_updated":"2026-05-30T07:59:21Z","snapshot_observed_at":"2026-08-14T18:26:22.873680Z","submitted_at":"2026-05-30T07:59:21Z","title":"ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-06-28T19:16:42.139096Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.00602"},"observation_digest":"sha256:5df3801fd5e8ad3c2f09999cb89bf00ebf2f750878563d4c0206c07ee6a6958f","observation_id":"ea2c4426-1b4b-405c-af9a-6ff7799d4ca4","resolution":{"observed_at":"2026-06-28T19:22:34.684060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.01049","last_updated":"2026-07-31T09:46:42Z","snapshot_observed_at":"2026-08-05T23:10:44.540398Z","submitted_at":"2026-05-31T06:38:30Z","title":"Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T17:26:11.320892Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.01049"},"observation_digest":"sha256:f108e2419ff883059d17ad1359d530936f07ae4365812fd25a1a311a43d6279b","observation_id":"300010db-b618-4773-b416-7a2cc7896dc4","resolution":{"observed_at":"2026-07-01T21:16:13.274792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-03T02:15:35.558277Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01049","last_updated":"2026-07-31T09:46:42Z","snapshot_observed_at":"2026-08-05T23:10:44.540398Z","submitted_at":"2026-05-31T06:38:30Z","title":"Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T02:15:35.558277Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.01049"},"observation_digest":"sha256:6126b32ad81a95f058b82ccbbdfa9568328776fea3ec08b44ff350ef506b3c87","observation_id":"8d814340-c964-4fe8-9278-27ee76009c6d","resolution":{"observed_at":"2026-08-03T02:15:35.558277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.07542","last_updated":"2026-05-01T17:28:59Z","snapshot_observed_at":"2026-08-12T17:30:15.230676Z","submitted_at":"2026-05-01T17:28:59Z","title":"DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-01T07:40:03.204845Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.07542"},"observation_digest":"sha256:fad9fb0b6017b36d61ddafac594806a4431463201f28dceaef5b566719678c05","observation_id":"7db60428-93a8-4ba5-8b6b-2ad303d57148","resolution":{"observed_at":"2026-07-01T08:05:31.552275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.11740","last_updated":"2026-06-10T07:16:27Z","snapshot_observed_at":"2026-08-02T02:17:16.809620Z","submitted_at":"2026-06-10T07:16:27Z","title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-27T10:21:12.782864Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.11740"},"observation_digest":"sha256:63aba1ac36862e7c3ee7a204241f39b30e400f61644bfa556493dd1479b6c797","observation_id":"8e4c68bb-cc2b-4cb5-91d6-c91760874cfc","resolution":{"observed_at":"2026-07-03T09:47:59.464703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.25375","last_updated":"2026-07-01T07:46:36Z","snapshot_observed_at":"2026-08-08T08:17:22.401077Z","submitted_at":"2026-06-24T04:08:41Z","title":"Text Over Image: Auditing Multimodal Robustness in Synthetic Medical Image Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T21:06:50.675960Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.25375"},"observation_digest":"sha256:b4b821fc3209f39d1b5c0a6fcac3e6075372dac82612e5da57d899f7a4b278b6","observation_id":"d11c7951-563c-4a7b-8f3d-432c08c256f9","resolution":{"observed_at":"2026-07-04T19:40:06.953227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.25375","last_updated":"2026-07-01T07:46:36Z","snapshot_observed_at":"2026-08-08T08:17:22.401077Z","submitted_at":"2026-06-24T04:08:41Z","title":"Text Over Image: Auditing Multimodal Robustness in Synthetic Medical Image Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-02T21:30:16.229864Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.25375"},"observation_digest":"sha256:8d5f06844fa2d8a1bf429a3984a1ac99778e4e481ed5e7a98d6f33bae7eedce1","observation_id":"c560eff4-4e4d-4240-86ae-3f3300c76016","resolution":{"observed_at":"2026-07-02T21:37:24.287126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.27500","last_updated":"2026-06-25T19:36:38Z","snapshot_observed_at":"2026-08-07T13:35:50.634455Z","submitted_at":"2026-06-25T19:36:38Z","title":"Aloe-Vision: Robust Vision-Language Models for Healthcare","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T02:02:47.472868Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.27500"},"observation_digest":"sha256:f75db983dfba06c6b82e7e5c2a3ec4a6181ec917000b7a6c225d72db15ac0623","observation_id":"b2b49093-3e06-4568-a8bf-e5ed9e92d9d6","resolution":{"observed_at":"2026-07-01T18:25:57.962003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2606.31599","last_updated":"2026-06-30T12:47:30Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:47:30Z","title":"Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T05:36:43.609602Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2606.31599"},"observation_digest":"sha256:9b0ed3cdc6abf055d5d8109019fb31517ee5e2727d6f5df284380f79ecb3d0b5","observation_id":"37ca057e-28d0-4518-b7ce-500f1bbbedaa","resolution":{"observed_at":"2026-07-01T10:25:41.018403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2607.01908","last_updated":"2026-07-02T09:08:46Z","snapshot_observed_at":"2026-08-06T18:42:36.265023Z","submitted_at":"2026-07-02T09:08:46Z","title":"Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-03T15:59:52.903025Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2607.01908"},"observation_digest":"sha256:ff5ebb959e5073f2ab58bfec3aba706e942738f5577b4269166ae77d19be0d56","observation_id":"0b9a290a-3e40-4665-9473-1097797549be","resolution":{"observed_at":"2026-07-03T16:08:36.894665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-11T19:56:14.354465Z","title":"arXiv preprint arXiv:2406.19280 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04344","last_updated":"2026-07-05T14:59:32Z","snapshot_observed_at":"2026-08-13T05:45:34.459776Z","submitted_at":"2026-07-05T14:59:32Z","title":"IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T19:56:14.354465Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2607.04344"},"observation_digest":"sha256:39becc09174f9d38d34445c3ff20f5f5bb7e795aab12ac9762c72c75fbd50e16","observation_id":"2215453b-b7dd-4452-8a2e-6a605180ce9d","resolution":{"observed_at":"2026-07-11T19:56:14.354465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":"2406.19280","doi":"10.48550/arxiv.2406.19280","metadata_source":"pith","pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.19280 , year=","venue":"cs.CV","work_id":"dd32b8a1-4ad4-4155-b031-c317b565c6e7","year":2024},"citing_paper":{"arxiv_id":"2607.05310","last_updated":"2026-07-06T16:49:10Z","snapshot_observed_at":"2026-08-03T23:41:18.582525Z","submitted_at":"2026-07-06T16:49:10Z","title":"Evaluating and Understanding Model Editing for Medical Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-07T18:09:33.751019Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2607.05310"},"observation_digest":"sha256:c318bf2583f02aacacf720d15c3802b8f0a3bd3e52dcaa45b6b75bc1c85bfecf","observation_id":"9916d025-d5a6-4d6c-9432-d8edf836a129","resolution":{"observed_at":"2026-07-07T18:14:03.435995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:37.302988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-31T06:20:29.702013Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-14T21:10:19.631080Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.702013Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:6eb317179f48969b1e9377c027ff96263a549bc57c377a53bf8199093224a76e","observation_id":"2c12473b-74ac-4ee9-8de7-42ac4d543ef4","resolution":{"observed_at":"2026-07-31T06:20:29.702013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-12T20:35:05.706759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10635","last_updated":"2026-08-11T08:22:13Z","snapshot_observed_at":"2026-08-14T21:10:31.786981Z","submitted_at":"2026-08-11T08:22:13Z","title":"MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:35:05.706759Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2608.10635"},"observation_digest":"sha256:fbfe1126a2fd11272b668f6429f853a293f8949176e207b979d24b91322b1470","observation_id":"2f7a5e43-7b84-4549-a896-6b8611bad252","resolution":{"observed_at":"2026-08-12T20:35:05.706759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-12T16:38:14.075007Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10827","last_updated":"2026-08-11T11:57:27Z","snapshot_observed_at":"2026-08-14T21:11:34.336374Z","submitted_at":"2026-08-11T11:57:27Z","title":"MIRA: Medical Image Reflection for Agentic Diagnosis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:14.075007Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2608.10827"},"observation_digest":"sha256:3ba28e54e22662ab34ef12251a6b730ec0dcb6a49e3a2449d6f9fc63946830a6","observation_id":"c8d131bf-753d-4450-8c8a-0f1ca67dbe61","resolution":{"observed_at":"2026-08-12T16:38:14.075007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.19280/citation-record","integrity":"/paper/2406.19280/integrity","json":"/paper/2406.19280/citation-record.json","paper":"/paper/2406.19280"},"outbound":[],"paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 69 inbound Pith citation observations for arXiv:2406.19280."}