{"as_of":"2026-08-13T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:168c01ab1dfac7a75099165c1f8210b804f2adf2e70d30d23f1d1f48c17ba9ae","coverage":[{"denominator":127,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:20:30.115352Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24743/citation-record","integrity":"/paper/2607.24743/integrity","json":"/paper/2607.24743/citation-record.json","paper":"/paper/2607.24743"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T06:20:29.650039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.650039Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:07a86c647c874be7ae1abfab94a818d801ca1866061da63eff7bc837b68e0a87","observation_id":"688ad64a-4194-4329-a302-5516cadadec9","resolution":{"observed_at":"2026-07-31T06:20:29.650039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T06:20:29.655604Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.655604Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:5b0e801d763e8c78f0f17c02b47f818443c1337a3a9dacbab5a6ff11cfb54668","observation_id":"349f8bd2-2ded-401a-8486-9512b3deb042","resolution":{"observed_at":"2026-07-31T06:20:29.655604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.660200Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.660200Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:9d5e541ad99b5177185977639b559724a558f65ab206eabbfad0f0ae062d7e19","observation_id":"3dd06eb9-99b0-40f8-828d-c3f00778136c","resolution":{"observed_at":"2026-07-31T06:20:29.660200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-31T06:20:29.664434Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.664434Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:1d218b0f58464cf3fd20fe05910d2743faff5b078cee2faf73c1e677075b9d2e","observation_id":"a96911c1-0072-49d4-864d-26b1f8ab2d15","resolution":{"observed_at":"2026-07-31T06:20:29.664434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.668884Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.668884Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:2858e02b099a913ea2a67fe7da5fde5e2ba9f4d6e12b8d356c75c98ef2ae582e","observation_id":"63f3b688-a626-4a43-85fb-2654e1785562","resolution":{"observed_at":"2026-07-31T06:20:29.668884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07044","last_updated":"2025-06-13T04:22:02Z","snapshot_observed_at":"2026-08-11T15:48:27.695863Z","submitted_at":"2025-06-08T08:47:30Z","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07044","snapshot_observed_at":"2026-07-31T06:20:29.673214Z","title":"Lingshu: A generalist foundation model for unified multimodal medical understanding and reasoning.arXiv preprint arXiv:2506.07044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.673214Z"},"links":{"cited_paper":"/paper/2506.07044","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:7c68a8a155c2d65b3bc2d8b2c9c679d444ac1bebf94522d9780df688818fa1a9","observation_id":"aba874c2-a026-4fd2-b4a4-731a5210f7b0","resolution":{"observed_at":"2026-07-31T06:20:29.673214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.678846Z","title":"Hulu-med: A transparent generalist model towards holistic medical vision-language understanding.arXiv preprint arXiv:2510.08668, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.678846Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:f77934192ef2188dc577eec3a60ecab9f7b8f6c0606e293b0c01b3644d23d2f9","observation_id":"dd47a75d-3903-441a-8942-a4f2eb05c14d","resolution":{"observed_at":"2026-07-31T06:20:29.678846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05201","last_updated":"2026-04-06T19:50:20Z","snapshot_observed_at":"2026-08-13T07:46:46.051699Z","submitted_at":"2025-07-07T17:01:44Z","title":"MedGemma Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05201","snapshot_observed_at":"2026-07-31T06:20:29.683476Z","title":"Medgemma technical report.arXiv preprint arXiv:2507.05201, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.683476Z"},"links":{"cited_paper":"/paper/2507.05201","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:57fcb55bce74ce53a54b55bea68102f6f12b2fab4165c159dd3f5e98a4d2326e","observation_id":"5b734fb2-dc20-4584-8703-961c506ed543","resolution":{"observed_at":"2026-07-31T06:20:29.683476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.693151Z","title":"Medvlm-r1: Incentivizing medical reasoning capability of vision-language models (vlms) via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.693151Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:30eb064a80ddeccd46be93fe1e99aa7e9ed0e35881ed0c6d3b3db2f0fa7d0786","observation_id":"8755a2ba-2e51-42bd-80de-a43a8b95054f","resolution":{"observed_at":"2026-07-31T06:20:29.693151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.697647Z","title":"Med- r1: Reinforcement learning for generalizable medical reasoning in vision-language models.arXiv preprint arXiv:2503.13939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.697647Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:370c9f5710c05240764c5176a49f7901abebca59a7b1ee18c57f0e603b9436b9","observation_id":"0b3a0f5f-d5e8-46a1-a864-7d452677729f","resolution":{"observed_at":"2026-07-31T06:20:29.697647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-12T23:33:31.821379Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-07-31T06:20:29.702013Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.702013Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:6350ff86342e288986ee200db88305eaa54864ad06783eb43927cc4034248fd1","observation_id":"2c12473b-74ac-4ee9-8de7-42ac4d543ef4","resolution":{"observed_at":"2026-07-31T06:20:29.702013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.706803Z","title":"A generalist vision–language foundation model for diverse biomedical tasks.Nature Medicine, 30(11):3129–3141, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.706803Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:bf50a228b6bc33fea8a8c0dba144db6527dae06ef0efb3e06b7adbef269a34f6","observation_id":"be92fe12-4dd8-4e57-8f9c-bfcd91512494","resolution":{"observed_at":"2026-07-31T06:20:29.706803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.711046Z","title":"Omn- imedvqa: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.711046Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:d8d429c05f07c99cd3d95c42f665ee158e11fa0332a42fcaf57b42ad4f942058","observation_id":"c19e5cb2-31e4-4fe3-a8a7-20a7cea10345","resolution":{"observed_at":"2026-07-31T06:20:29.711046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.715200Z","title":"Slake: A semantically-labeled knowledge- enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.715200Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:70962506926c22776cbd54db971dd251ce83ed37a8c7889aaa88aabc6870adb1","observation_id":"18b50e56-e3fe-4c59-a3b3-b74111262837","resolution":{"observed_at":"2026-07-31T06:20:29.715200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.719488Z","title":"Generalist foundation models from a multimodal dataset for 3d computed tomography.Nature Biomedical Engineering, pages 1–19, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.719488Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:4450ba04cf3b3869d299d94da87004121a707c4a5edf4f233a7caa0c35f408dc","observation_id":"4ad5dd33-9273-4382-9b97-c1255719f2d4","resolution":{"observed_at":"2026-07-31T06:20:29.719488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.724241Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.724241Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:e44635f6d62e7eef39bf0f6f5c3d24d8222028cfcdf858a086ceb21be52a95b2","observation_id":"210aef49-4e8d-4ae8-a311-b98061527cc1","resolution":{"observed_at":"2026-07-31T06:20:29.724241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.733500Z","title":"Medxpertqa: Benchmarking expert-level medical reasoning and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.733500Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:db354314b3bcbaf71faac30d17fff6a2b2bfe3134c71353445842aedc38012c9","observation_id":"d74a9669-f3fd-419a-b0e2-a8e961260548","resolution":{"observed_at":"2026-07-31T06:20:29.733500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.737585Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.737585Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:b1e2c6adbd37824dfbfa3a56fcd4772bf788ebc9ea31b56aea61deb591d67c17","observation_id":"1623dc72-a475-45b3-9c22-5b5d251b6b30","resolution":{"observed_at":"2026-07-31T06:20:29.737585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-025-57426-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards a holistic framework for multimodal LLM in 3D brain CT radiology report generation.Nature Communications, 16(1):2258, 2025","venue":"Nature Communications","work_id":"bc034da4-8881-4eed-83aa-ed0195fe4f0c","year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.741466Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:51af9f3c8aadecbd2d64570f47ae938daa1cea25c6ff37fdbea00e5ed6ed8f9b","observation_id":"4b315706-af7f-44c2-a99c-abd0e690293e","resolution":{"observed_at":"2026-07-31T06:20:56.545754Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.745685Z","title":"Med3dvlm: An efficient vision-language model for 3d medical image analysis.IEEE Journal of Biomedical and Health Informatics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.745685Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:e3bf1357a07a93492a0d51485ec1abf88ec9955f7a21ffcf142e15c4e4c3c117","observation_id":"a1ce074b-85e6-4ec6-8a9f-5a17c378d055","resolution":{"observed_at":"2026-07-31T06:20:29.745685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.749856Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data.Nature Communications, 16(1):7866, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.749856Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:a43ef52b7b03b8fb589aa4dc1a4a0f16feb4e2fcc1cff7dc39926074e30fdda2","observation_id":"3a62ce93-2cff-423e-9fd2-51b951816f66","resolution":{"observed_at":"2026-07-31T06:20:29.749856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.754042Z","title":"Chaunzwa, Simon Bernatz, Ahmed Hosny, Raymond H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.754042Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:00e02d5cc8270246c00874cb9206db7d6d6f2eda5ec7c0bccda1116403f23b2f","observation_id":"dfc17799-a2e0-4108-9c70-1c3f349ac05c","resolution":{"observed_at":"2026-07-31T06:20:29.754042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.758357Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.758357Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:939c8104af9eab389a4af5e7bc0a162652fbe3fedeacbaafbea44d6811c26790","observation_id":"48887214-bd09-4b60-990a-71e6decaaa8a","resolution":{"observed_at":"2026-07-31T06:20:29.758357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.763082Z","title":"Eagle-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.763082Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:27a75fe82ecb52f6be2c738093b637372a60ba8da761b9edd2b469b6ed65ee3f","observation_id":"d2ce34c7-52cc-43da-b23b-f4584169ce5e","resolution":{"observed_at":"2026-07-31T06:20:29.763082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.767417Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.767417Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:6ab36e6d2bbb741dadccf2b27491bc6d966a299302439478fcc9960640559cb9","observation_id":"7d5e7133-0421-4f48-8fdf-57c255b3cadc","resolution":{"observed_at":"2026-07-31T06:20:29.767417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.771725Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.771725Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:aeb46187afb603d28ccc0fa841f69e03c84f04848ccece148b9c3107eeeffcff","observation_id":"f29ee6d0-04d5-475c-a188-3895e076f8bf","resolution":{"observed_at":"2026-07-31T06:20:29.771725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.775668Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.775668Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:68d1e0c284e9b33057d9430ba681ecc38c9ee5fada9b5c00d6a00dac82e4a5fe","observation_id":"2d1c42fd-5af8-4da6-a155-5163e083b38c","resolution":{"observed_at":"2026-07-31T06:20:29.775668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.780141Z","title":"Feast your eyes: Mixture- of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.780141Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ca59ad89fd089ab5b62838cd78b0016c82b2953dbd7238da516cdea950f80a21","observation_id":"10e4f40b-8f19-48a1-9d59-9655bd1b4cfd","resolution":{"observed_at":"2026-07-31T06:20:29.780141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.784508Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.784508Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:1f1c7cd16d51d537fbb428dc0a91ec9e438b333c1b790bcb65be97124c458e3e","observation_id":"5080d7c1-0871-46ea-b646-14bbdba9553b","resolution":{"observed_at":"2026-07-31T06:20:29.784508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.788820Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.788820Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:3d51ac568e7069dacb32eb1738a7ac8b91bb250b2166658e8312a4e1127f1f8e","observation_id":"6505c687-0dac-4779-b7d5-58a405e2bebd","resolution":{"observed_at":"2026-07-31T06:20:29.788820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.792972Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.792972Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:7a0a547979b7ca63a6d4ace5795b565c7dcb18eaf1612921395ffe442913d1f6","observation_id":"da605372-68d6-42fe-97ac-461ba0f4ab64","resolution":{"observed_at":"2026-07-31T06:20:29.792972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.797458Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.797458Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:74373dc4435d0688f2b58afc3b61a58021e284b8c8126fb272269e6b7b02e9ee","observation_id":"30f4c534-4b37-48e9-9daf-96ed1d01a57a","resolution":{"observed_at":"2026-07-31T06:20:29.797458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.801602Z","title":"Improving the factual correctness of radiology report generation with semantic rewards","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.801602Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ec735376dbc0f150c423e669b637f2ca42660c6d1a3bbf83157500862f1e6841","observation_id":"954d929a-361c-468c-b218-3f77940b49d5","resolution":{"observed_at":"2026-07-31T06:20:29.801602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.805839Z","title":"Ratescore: A metric for radiology report generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.805839Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:a785850dba4792dfaacb01260fed1e7f810ceec14bc203e447fa3db5e972e4a1","observation_id":"74eeecf1-9592-4266-8097-c60e77b72016","resolution":{"observed_at":"2026-07-31T06:20:29.805839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.809882Z","title":"Green: Generative radiology report evaluation and error notation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.809882Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:bb60818a049b82be6537054286416a82281dddbfd30439122e4a33f559a11ee7","observation_id":"8a447070-b784-423a-a197-19e059605aa6","resolution":{"observed_at":"2026-07-31T06:20:29.809882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.814169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.814169Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:670257afd38ca87abd49668adbc71457abc9ad03d8233990911fdebdd1e5ce64","observation_id":"00563525-fba1-4245-bf9e-62c9a1c389c8","resolution":{"observed_at":"2026-07-31T06:20:29.814169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.818221Z","title":"A survey of llm-based agents in medicine: How far are we from baymax?Findings of the Association for Computational Linguistics: ACL 2025, pages 10345–10359, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.818221Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:63587b40cf2531662dfac4bffcc188062acc3b961297ef0c4abb120f3cd924f7","observation_id":"1cf78e50-f8f3-4ae8-93c7-8aa8e981fd7f","resolution":{"observed_at":"2026-07-31T06:20:29.818221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18968","last_updated":"2025-07-02T06:36:32Z","snapshot_observed_at":"2026-08-08T12:55:27.752437Z","submitted_at":"2025-03-21T14:04:18Z","title":"MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18968","snapshot_observed_at":"2026-07-31T06:20:29.822404Z","title":"Medagent- pro: Towards evidence-based multi-modal medical diagnosis via reasoning agentic workflow.arXiv preprint arXiv:2503.18968, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.822404Z"},"links":{"cited_paper":"/paper/2503.18968","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:9b2285630c045ed73bdb4bb4d77a45ac3bfa31e1adb26804b6c19f9d5b474448","observation_id":"bc66c442-7f39-4550-9600-e60ee3641b9b","resolution":{"observed_at":"2026-07-31T06:20:29.822404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.826778Z","title":"Mmedagent: Learning to use medical tools with multi-modal agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.826778Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:571198590b9404e9fc6e79e229d588933bd86a3d2b883658ae25845a80e70a80","observation_id":"3c851925-2376-4bd7-9795-d9bd6eed143d","resolution":{"observed_at":"2026-07-31T06:20:29.826778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-31T06:20:29.831234Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.831234Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:159bd18fe9ab05b0e972f6c59f4d7cc9888daaac0ea104473e23840a351e85c9","observation_id":"34d450f4-b668-41e3-8946-f4ea977c0be5","resolution":{"observed_at":"2026-07-31T06:20:29.831234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.835505Z","title":"Bimedix2: Bio-medical expert lmm for diverse medical modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.835505Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:63d54aa2dc887dfb67c89aa4413a9a79957bc23dcab08eda086eb410caed9cc9","observation_id":"71b7a39e-7caf-4228-9a4b-f294a9286220","resolution":{"observed_at":"2026-07-31T06:20:29.835505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.839618Z","title":"Healthgpt: A medical large vision-language model for unifying comprehension and generation via heterogeneous knowledge adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.839618Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:58e9d96e289efa1ec2c3b701ed7f97eacef31f8c040ced96050f4874d81c8713","observation_id":"1999e115-1bfd-43c6-9356-644332f9ddce","resolution":{"observed_at":"2026-07-31T06:20:29.839618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15127","last_updated":"2024-11-04T15:54:21Z","snapshot_observed_at":"2026-08-13T00:23:43.574930Z","submitted_at":"2024-04-23T15:27:19Z","title":"GSCo: Towards Generalizable AI in Medicine via Generalist-Specialist Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15127","snapshot_observed_at":"2026-07-31T06:20:29.844422Z","title":"Gsco: Towards generalizable ai in medicine via generalist-specialist collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.844422Z"},"links":{"cited_paper":"/paper/2404.15127","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:bcdba786f04f6cb1392b92683efb67eafcbe686fef8aab52445df9c5abebea5a","observation_id":"7f69231d-8d33-486d-929c-3cd549cabdd6","resolution":{"observed_at":"2026-07-31T06:20:29.844422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.849030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.849030Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:1d0c616004a41e5d58fd21f3749ec7246b395fb197e1f5deb7d0d028bd508052","observation_id":"682d512d-c8a4-41c4-bb8d-8f2a23dd6e79","resolution":{"observed_at":"2026-07-31T06:20:29.849030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.864324Z","title":"3d-rad: A comprehensive 3d radiology med-vqa dataset with multi-temporal analysis and diverse diagnostic tasks.arXiv preprint arXiv:2506.11147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.864324Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:36e8bfd0395c7aace4469654526239239cfc9c8591dde83de9979f091843bfb8","observation_id":"0ced1486-3e33-439b-864f-1bb054377bfa","resolution":{"observed_at":"2026-07-31T06:20:29.864324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.869180Z","title":"Amos: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation.Advances in neural information processing systems, 35:36722–36732, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.869180Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:974f4ca3d9425f2b9a1183920e3a947bfcaddb2a38f3074435a4c656a3d52a2f","observation_id":"f19110b7-9d69-4be2-ba0c-6277f055a8b5","resolution":{"observed_at":"2026-07-31T06:20:29.869180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.874150Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.874150Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:d8954798dececa256db8dd9e6028e2cdc9573f1895549ded1f1d80d80bdcfc56","observation_id":"5e5af2aa-0fb2-443a-928f-7d2d087eacd6","resolution":{"observed_at":"2026-07-31T06:20:29.874150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.878777Z","title":"RadGraph-XL: A large-scale expert-annotated dataset for entity and relation extraction from radiology reports","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.878777Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:df505cdcdf446057dd5cefe1c9125a0f7b69ea19b86511074c3536140fe246e0","observation_id":"4304564b-fd87-4f6d-9dba-5e209839f70c","resolution":{"observed_at":"2026-07-31T06:20:29.878777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.883448Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.883448Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:45f9bb428f87d9397430fedf8ec28d2777ce59c8f166ce607240150e3a3027f6","observation_id":"1543372b-c5d7-4443-a577-3f5076039b8c","resolution":{"observed_at":"2026-07-31T06:20:29.883448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.887609Z","title":"Position: Compositional generative modeling: A single model is not all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.887609Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:c80b2afe81b232a67f4f4658da906d740fa3cca104b76cb95a3fd462f8af32fd","observation_id":"bd93326b-7a8b-4b29-a647-693440de4ffc","resolution":{"observed_at":"2026-07-31T06:20:29.887609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.892067Z","title":"A convnet for the 2020s.Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.892067Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:e81a304a47013c85fe2ee9b343f361a90797ec349982b2921b708804a39053ac","observation_id":"2c418c22-aee1-4e89-aa7e-a474ae753f87","resolution":{"observed_at":"2026-07-31T06:20:29.892067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.896289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.896289Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:b3ad51975ac524fd9e55b29b203ed6e73708bb5d170e65bed7d42c1c8e32fd7d","observation_id":"f61d1b31-4371-4300-85f9-8f0dc26897f6","resolution":{"observed_at":"2026-07-31T06:20:29.896289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.900617Z","title":"Exploring scalable medical image encoders beyond text supervision.Nature Machine Intelligence, 7(1):119–130, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.900617Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:37c0345f55f40744d4ca20a3eadd25b789d418592082dad3b71fcfa3cd30a464","observation_id":"7be93ead-d69b-4dfd-ac23-e88a0f103224","resolution":{"observed_at":"2026-07-31T06:20:29.900617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.905366Z","title":"A multimodal biomedical foundation model trained from fifteen million image–text pairs.Nejm Ai, 2(1):AIoa2400640, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.905366Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:f56ff64dc4853b15161035250cfcbdd536680fbf61f5c9c400613e2450fcdbe2","observation_id":"a4f6110b-4507-4485-9621-b0c65035518c","resolution":{"observed_at":"2026-07-31T06:20:29.905366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.909560Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.909560Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:5eb063922ced3f49aef904cd6aadb75113cc6afa11678e33c30960d78410fbed","observation_id":"4df93691-7ce3-48aa-9912-133539a07a24","resolution":{"observed_at":"2026-07-31T06:20:29.909560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.913652Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.913652Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:9b290265a97f8a69d5f77a43636c504e61eeca36740cbba8b9cfbae8bbb9d663","observation_id":"38502715-f4d4-4147-a183-59a62a097b6b","resolution":{"observed_at":"2026-07-31T06:20:29.913652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.918023Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.918023Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ea7de611c829d12ad0cd7b4af2866313e7060d5967952f2d156b950fb07fc65e","observation_id":"cfb0ae7e-81b0-4a1f-baf9-03bb01564451","resolution":{"observed_at":"2026-07-31T06:20:29.918023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.922247Z","title":"Deepstack: Deeply stacking visual tokens is surprisingly simple and effective for lmms.Advances in Neural Information Processing Systems, 37:23464–23487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.922247Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:981062249b1b57af4558bea6715f44c23c1dfac9af5175ac67abad2e887ecf50","observation_id":"31c4033e-3bc0-4396-b0fe-ac91b5baedfc","resolution":{"observed_at":"2026-07-31T06:20:29.922247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-08-11T19:32:15.215968Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-07-31T06:20:29.926532Z","title":"Perception encoder: The best visual embeddings are not at the output of the network.arXiv preprint arXiv:2504.13181, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.926532Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:f4c080ae591697455a5c7263ae81b79fba57c84a3ecbe6547a079e4f2e5d7b1f","observation_id":"b4cbec94-23d4-49eb-a553-a513b6a4887f","resolution":{"observed_at":"2026-07-31T06:20:29.926532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-021-00425-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalized radiograph representation learning via cross-supervision between images and free-text radiology reports.Nature Machine Intelligence, 4(1):32–40, 2022","venue":"Nature Machine Intelligence","work_id":"c2709de6-04ff-400d-9986-5f28920255fc","year":2022},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.931059Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:9045971571935d8cce2c3ae6004c1845dfd72756c69dae4fd8877ee886f395b2","observation_id":"3e70cf8e-e305-4cc9-89c9-212a3477561f","resolution":{"observed_at":"2026-07-31T06:20:56.429503Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.935881Z","title":"Huatuogpt, towards taming language model to be a doctor","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.935881Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:501b7161fc3bf4550069227cab6ee977b2ba67514e32e4b8d3b88508bf936122","observation_id":"64387d1d-4d25-4d61-a423-b2c7d9693099","resolution":{"observed_at":"2026-07-31T06:20:29.935881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.940553Z","title":"State of what art? a call for multi-prompt llm evaluation.Transactions of the Association for Computational Linguistics, 12: 933–949, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.940553Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ea83990eb17599f712422344d01c01f95694cb15daacbf83964909b2a0df6551","observation_id":"a4a7c094-d03c-48f6-8ade-236f3518099e","resolution":{"observed_at":"2026-07-31T06:20:29.940553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.944785Z","title":"Surveillance, epidemiology, and end results (seer) program (www.seer.cancer.gov), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.944785Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ee14682b779859913468dc102e94d47410865a43be1d0d3c786d1871067eea5a","observation_id":"06246414-fd9f-43a5-8f22-9ea711e55c07","resolution":{"observed_at":"2026-07-31T06:20:29.944785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.949392Z","title":"Look again, think slowly: Enhancing visual reflection in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.949392Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:38ad514bcc64515516b792c1034aee28b3ec78939a02a0adb564727ef59cf179","observation_id":"e0874377-4866-4051-8d9f-6a3603acbcb3","resolution":{"observed_at":"2026-07-31T06:20:29.949392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T00:40:43.568520Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-31T06:20:29.953458Z","title":"Meng, and Bo Zhao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.953458Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:12da7c6594a3361eb2c75b98b960b3604e0a381d034f6b600fd048f4422d7bf5","observation_id":"9b759028-84a6-47a2-ba64-7c60aba90e4a","resolution":{"observed_at":"2026-07-31T06:20:29.953458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.957764Z","title":"Merlin: a computed tomography vision–language foundation model and dataset.Nature, pages 1–11, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.957764Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:b258360d2b091b0de88b50a4565a541d2fab6bb8013c223382a59af4c665acf8","observation_id":"5e511336-50fd-469f-8431-52dae50e0fdf","resolution":{"observed_at":"2026-07-31T06:20:29.957764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.962001Z","title":"Inspect: A multimodal dataset for patient outcome prediction of pulmonary embolisms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.962001Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:2bdc78d8135e41e252219ef2fe850dfe6be242bf830e9dedc623c300fce9f69a","observation_id":"84157aed-d860-4493-a2e7-510412f936f5","resolution":{"observed_at":"2026-07-31T06:20:29.962001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.966447Z","title":"Vista3d: A unified segmentation foundation model for 3d medical imaging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.966447Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:c7fba4004a97d2c22b17d33cf69613fe385d1c8582aa11ecb9034caffcf24255","observation_id":"04772d10-3435-4fc5-8d68-98c7db1754e6","resolution":{"observed_at":"2026-07-31T06:20:29.966447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.970641Z","title":"Totalsegmentator: robust segmentation of 104 anatomic structures in ct images.Radiology: Artificial Intelligence, 5(5):e230024, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.970641Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:98b2b2b1e693d378a9d12fd7b778c60ca6f139472452f245fb2af6beeda3a07e","observation_id":"c365480e-31b9-4f43-9d62-45c4c010eace","resolution":{"observed_at":"2026-07-31T06:20:29.970641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13154","last_updated":"2024-11-20T09:43:30Z","snapshot_observed_at":"2026-08-12T23:31:22.197013Z","submitted_at":"2024-11-20T09:43:30Z","title":"DMQR-RAG: Diverse Multi-Query Rewriting for RAG","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13154","snapshot_observed_at":"2026-07-31T06:20:29.975213Z","title":"Dmqr-rag: Diverse multi-query rewriting for rag.arXiv preprint arXiv:2411.13154, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.975213Z"},"links":{"cited_paper":"/paper/2411.13154","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ca32a52e1c6d69ab1a311ede15b6c007d9c930307fad78c659795acafd456e4f","observation_id":"2c1b3231-9293-4041-ac81-a230c24044ba","resolution":{"observed_at":"2026-07-31T06:20:29.975213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.979544Z","title":"UMLS knowledge sources, release 2024aa, 2024.http://www.nlm.nih.gov/ research/umls/licensedcontent/umlsknowledgesources.html(accessed 15 July 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.979544Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ecaa8accc20a0b7e326d2edf28de0f0c77003ea296d6089653c38fb515989414","observation_id":"e46f354f-7c63-43b2-b8b3-82c6b1050814","resolution":{"observed_at":"2026-07-31T06:20:29.979544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.983879Z","title":"Building a knowledge graph to enable precision medicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.983879Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:64060ee8ca62ad0eafd8744243cf834d1bde19709b531dabe8a99e97011cfad6","observation_id":"03895d10-25c3-4a81-8d4e-771d8ab7785a","resolution":{"observed_at":"2026-07-31T06:20:29.983879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/nar/gkad1044","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sayers, Evan E","venue":"Nucleic Acids Research","work_id":"6826dcbd-5458-41ea-856b-d71a051d7db8","year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.988047Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:4d82765ba884a25ef66a0ec77b6b56707c81de924bd65900e172410bd0850b6d","observation_id":"5fb49e35-285a-4a91-a43c-3b8d4ba5cb26","resolution":{"observed_at":"2026-07-31T06:20:56.390675Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.992608Z","title":"StatPearls Publishing, Treasure Island, FL, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.992608Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:c727e29d62c897156752a424baf69845310d8ff1744d422cb9e18dea3c22b29a","observation_id":"384e0de7-46d0-4a79-8e44-520119b13afa","resolution":{"observed_at":"2026-07-31T06:20:29.992608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:29.997011Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams.Applied Sciences, 11 (14):6421, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.997011Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:18f66ad228914627364bc34f50954fa1a1124deb64580878591276e21d1f422d","observation_id":"abe30840-efc1-49ed-bbe7-c2d0b02a7aa8","resolution":{"observed_at":"2026-07-31T06:20:29.997011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.001898Z","title":"Xiong, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.001898Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:3bddaf1371dca3022a33bc971f03d305857bd6ba7bb4dc8b74d485f892c38841","observation_id":"a656dbeb-ed18-4bab-9941-bd063f1b57b4","resolution":{"observed_at":"2026-07-31T06:20:30.001898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.006389Z","title":"Multi-modal ai for opportunistic screening, staging and progression risk stratification of steatotic liver disease.Nature Communications, 17(1):1562, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.006389Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:5043fa8f1c626643e8fab6e89c423944d12249c2268eff57b18d9316fc7f31d0","observation_id":"3708dfa9-d6a4-4317-831a-718fb0560e1f","resolution":{"observed_at":"2026-07-31T06:20:30.006389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.011190Z","title":"Effective lymph nodes detection in ct scans using location debiased query selection and contrastive query representation in transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.011190Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:63b3c224bfe1f52fb7d19c296d38a6607060aff42ade666c0d936e4a197b1958","observation_id":"6042fd0f-a957-43bd-8664-2c3c213c0fd4","resolution":{"observed_at":"2026-07-31T06:20:30.011190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.016358Z","title":"On the limits of cross-domain generalization in automated x-ray prediction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.016358Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:21e442d308b40bae57b19badd38078fcd896aee2f76e41c7892a5bf3c191929f","observation_id":"159ffc65-f324-454c-a538-0d1d3e18b61e","resolution":{"observed_at":"2026-07-31T06:20:30.016358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.020989Z","title":"Kalra, and Pingkun Yan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.020989Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:8172267d584a2ad8861582d6898e5b6bc967711d340eaa0a01dad5db69686a32","observation_id":"e919322b-8d10-48ed-996e-b91ea5d17d1c","resolution":{"observed_at":"2026-07-31T06:20:30.020989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-13T04:37:30.902017Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-07-31T06:20:30.025041Z","title":"Tsai, Andrew Johnston, Cameron Olsen, Tanishq Mathew Abraham, Sergios Gatidis, Akshay S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.025041Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:a61e06abeb7f353a762f26a3d05f3ea798e18d3f791ea13775891b9d35f36e8f","observation_id":"a093b395-a272-4cb4-8da1-a57e4c359fca","resolution":{"observed_at":"2026-07-31T06:20:30.025041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.029504Z","title":"Pmc-clip: Contrastive language-image pre-training using biomedical documents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.029504Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:53ee5c821b8129581cea610a73e54380e79e71419f92ba8bf02ee0d2dfae7cf5","observation_id":"b5b38be1-7521-4b5c-adfc-85ff63c74427","resolution":{"observed_at":"2026-07-31T06:20:30.029504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.033853Z","title":"Friedrich","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.033853Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:b7d822961d65a2e6c2b497c92925a6a5b0c21744c78406f3b8a5f9e2b297614d","observation_id":"58a121f4-155e-4ada-b1ab-f3173442f15f","resolution":{"observed_at":"2026-07-31T06:20:30.033853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.038050Z","title":"Seco de Herrera, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.038050Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:59acb304d8719fbbd0d1932f04850fca1059b8d976623bebaa2975635c7ac29b","observation_id":"c1add6ae-b71d-4d34-9289-1c6a762659e1","resolution":{"observed_at":"2026-07-31T06:20:30.038050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.042211Z","title":"Towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.042211Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:23ae9c0b99da0f1d52c55891007d3525614ce13ffffeabc423e6d82a8c1c1ae9","observation_id":"105fe18f-caf5-4881-ae5d-36a9392a8f7f","resolution":{"observed_at":"2026-07-31T06:20:30.042211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.046871Z","title":"Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports.Scientific data, 6(1):317, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.046871Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:91ba0a4315b42ed3abef2b4b9073e658b09d1733edf57cfa16fb06bd427d028e","observation_id":"59a2440a-d3e0-4a68-9668-59930d2c371b","resolution":{"observed_at":"2026-07-31T06:20:30.046871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.056055Z","title":"Medicat: A dataset of medical images, captions, and textual references","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.056055Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:140a655d8beba4010ee2f4e9eab9a857ab33d88f220867859d1a58754709105f","observation_id":"ccb2ac9a-77c4-4063-8d35-e192150b92b9","resolution":{"observed_at":"2026-07-31T06:20:30.056055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.060699Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.060699Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:e352bc7649ef51a8935508d42207091b942be3a04c3ee7f88c3a7c72b8d7f930","observation_id":"d015b708-69f2-4042-8c6a-3fc7a8411b2b","resolution":{"observed_at":"2026-07-31T06:20:30.060699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.065156Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.065156Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:53aaa427fc2dbb4194e79a0014d7461e72b9e662d0b6494e182d6407b7622c9c","observation_id":"07e4553a-9360-42d5-95fa-27317f889765","resolution":{"observed_at":"2026-07-31T06:20:30.065156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.069484Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.069484Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:7e470dd1aff2f5e05816be358b414a0ba1a403ef60c984a1e1ecacbafeaefe2c","observation_id":"63c57ade-5f9c-4fd5-affb-f688d969e969","resolution":{"observed_at":"2026-07-31T06:20:30.069484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.073880Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.073880Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:7924ae96d577ac86479acf616cfb9a7e4673c20e748cc33b63d73200047cabba","observation_id":"1e5965f2-1145-42a5-9ee1-e80072f3dab6","resolution":{"observed_at":"2026-07-31T06:20:30.073880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.078185Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.078185Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:962a1656ee658e5e13448e2554ee55549630ba07904ca347f0263fee251cc3b7","observation_id":"01c68a65-9112-43cf-a98d-25e9db79fa09","resolution":{"observed_at":"2026-07-31T06:20:30.078185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.082969Z","title":"Quilt- llava: Visual instruction tuning by extracting localized narratives from open-source histopathology videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.082969Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:b9b722b1150bdfa98d3afcd1416f60365bd10959d08615d57bbf3a44da2afade","observation_id":"b64b981d-a68c-4836-8ffe-03af00a43128","resolution":{"observed_at":"2026-07-31T06:20:30.082969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.087647Z","title":"Hicks, Vajira Thambawita, Pål Halvorsen, and Michael A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.087647Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:ced41895719888acb92fe444adb177b58c3a7fa5a2a2c50a076c0e471c4a0833","observation_id":"f1f8acc9-da48-4bef-bd68-a6477220783d","resolution":{"observed_at":"2026-07-31T06:20:30.087647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.091803Z","title":"MIMIC-Ext-MIMIC-CXR-VQA: A complex, diverse, and large-scale visual question answering dataset for chest x-ray images, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.091803Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:8f8c67826b6af40dc56663f2a36386296afbb4f1684069a2b15adbb3ee8b918f","observation_id":"4f143619-ee0e-4ef5-96f7-5b29a2406603","resolution":{"observed_at":"2026-07-31T06:20:30.091803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.096393Z","title":"Towards visual question answering on pathology images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.096393Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:121c65293610a4ba0faaea1f8a1b39b975595af73ed535c70989213d9d0d6736","observation_id":"9c99380f-b213-4281-ba1c-f98dce2d3856","resolution":{"observed_at":"2026-07-31T06:20:30.096393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.101128Z","title":"Development of a large-scale medical visual question-answering dataset.Communications Medicine, 4(1):23, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.101128Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:6d47a5e015ad2a5ee4b1d251894d60ce4a5222269c824814fee9788f494db8a2","observation_id":"ae49aa77-1870-44e2-8298-90c3dbdc2ca8","resolution":{"observed_at":"2026-07-31T06:20:30.101128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.105764Z","title":"Hasan, Vivek V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.105764Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:c31601fd573563268e6ef3caa4b33f427fb1c1702811754d5b7df06d77702af3","observation_id":"715c13e9-60ac-49c9-b201-4f5b5e915322","resolution":{"observed_at":"2026-07-31T06:20:30.105764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:20:30.110246Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.110246Z"},"links":{"citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:1ef946980d35c0d6348c05581f2ccd59bb7fc35f4b06c6003843ef7de66f8db8","observation_id":"2be0753d-faab-421f-a9a6-656381fbae80","resolution":{"observed_at":"2026-07-31T06:20:30.110246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01886","last_updated":"2025-04-02T16:43:16Z","snapshot_observed_at":"2026-08-11T23:21:05.629271Z","submitted_at":"2025-04-02T16:43:16Z","title":"GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01886","snapshot_observed_at":"2026-07-31T06:20:30.115352Z","title":"Gmai-vl-r1: Harnessing reinforcement learning for multimodal medical reasoning.arXiv preprint arXiv:2504.01886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.115352Z"},"links":{"cited_paper":"/paper/2504.01886","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:af4d310c86bc25455f6ac516fa8ee7ffd5ee758752a0b650932e69372e3361f2","observation_id":"f5b30254-a857-401d-8ab4-7216c357b7dc","resolution":{"observed_at":"2026-07-31T06:20:30.115352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T13:31:23.305118Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":127},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 127 outbound references and 0 inbound Pith citation observations for arXiv:2607.24743."}