{"as_of":"2026-08-20T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e83091a5abf3ef9a7cd785a023ef2168c565a3bff49faf36a4282cd7e107e45","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:31:47.529613Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13860/citation-record","integrity":"/paper/2607.13860/integrity","json":"/paper/2607.13860/citation-record.json","paper":"/paper/2607.13860"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.15892","last_updated":"2025-03-20T06:43:36Z","snapshot_observed_at":"2026-08-16T12:48:23.187544Z","submitted_at":"2025-03-20T06:43:36Z","title":"UMIT: Unifying Medical Imaging Tasks via Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15892","snapshot_observed_at":"2026-08-02T03:31:44.119733Z","title":"Umit: Unifying medical imaging tasks via vision-language models.arXiv preprint arXiv:2503.15892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.119733Z"},"links":{"cited_paper":"/paper/2503.15892","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:5a6bdc1a4144b4d94be7428f06e0f4d5b608d0e659e76e7dfd49f6a435ea0dbd","observation_id":"f267c368-c8e3-45b6-9571-8693138882aa","resolution":{"observed_at":"2026-08-02T03:31:44.119733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:44.202455Z","title":"Multimodal large language models in health care: applications, challenges, and future outlook.Journal of medical Internet research, 26:e59505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.202455Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:264103d198e380b94af08ac611013cd8e13b0304e9e93df723062fa0b40813aa","observation_id":"028ef95d-9739-42d7-9533-76d20b68b02d","resolution":{"observed_at":"2026-08-02T03:31:44.202455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:44.340085Z","title":"Towards generalist biomedical ai.Nejm Ai, 1(3):AIoa2300138, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.340085Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:17fd28e4799133ab9e913aac2b8a37344cc0a53dffbf0d61856eca861c33c1dd","observation_id":"728bdb0a-e697-4690-9324-517469dbba55","resolution":{"observed_at":"2026-08-02T03:31:44.340085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07044","last_updated":"2025-06-13T04:22:02Z","snapshot_observed_at":"2026-08-13T15:46:47.339256Z","submitted_at":"2025-06-08T08:47:30Z","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07044","snapshot_observed_at":"2026-08-02T03:31:44.522775Z","title":"Lingshu: A generalist foundation model for unified multimodal medical understanding and reasoning.arXiv preprint arXiv:2506.07044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.522775Z"},"links":{"cited_paper":"/paper/2506.07044","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:8932cbe7ce24775905cf3befe0bf129824e04d132994d538cd3fdeddaf535be7","observation_id":"a32a33bc-89e9-47b4-b6bf-9559b8758441","resolution":{"observed_at":"2026-08-02T03:31:44.522775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:44.625173Z","title":"Fleming-vl: Towards universal medical visual reasoning with multimodal llms.arXiv preprint arXiv:2511.00916, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.625173Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:a7accb6fbd2bc6cf84f4470196ef44ddbd79c164140725d69af78e874dae577b","observation_id":"f4090076-4f3b-40d8-b1e5-40a4474d7cf3","resolution":{"observed_at":"2026-08-02T03:31:44.625173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:44.725054Z","title":"Hulu- med: A transparent generalist model towards holistic medical vision- language understanding.arXiv preprint arXiv:2510.08668, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.725054Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:edc42f250d2c1cf28d3d5ad33238b35c160adc1f5e3eb58537f1c4307b885b8b","observation_id":"2131d970-231a-4dc3-ba50-d19923978daf","resolution":{"observed_at":"2026-08-02T03:31:44.725054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:44.825171Z","title":"Developing generalist foundation models from a multimodal dataset for 3d computed tomog- raphy.arXiv preprint arXiv:2403.17834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.825171Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:4c475799f740bcab78284244c66c55db92c5595bdc65caddf665c44c3034708e","observation_id":"12d06de5-21f6-421e-81bd-bcea88869544","resolution":{"observed_at":"2026-08-02T03:31:44.825171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:44.948172Z","title":"Towards a holistic framework for multimodal llm in 3d brain ct radiology report generation.Nature Communications, 16(1):2258, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:44.948172Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:8c3cab91e3cc512f680b7a2f3700c9f555a1180396113499d5c9f63bcac5476d","observation_id":"6cb2eaed-abfe-4a6c-b6e1-6ef473744412","resolution":{"observed_at":"2026-08-02T03:31:44.948172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.042591Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36:28541–28564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.042591Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:56a12f59f364db56d76de8632dddb4ec578bb859075a0585c8d0238e4905efed","observation_id":"db3fb6d4-3eca-4697-abd9-6db00c45a49e","resolution":{"observed_at":"2026-08-02T03:31:45.042591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-08-18T14:56:57.492279Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-02T03:31:45.138426Z","title":"Biomedclip: a multimodal biomedical foundation model pre- trained from fifteen million scientific image-text pairs.arXiv preprint arXiv:2303.00915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.138426Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:bd38950a4f7e33f0cbdf71fe50b89daed721dfdde6ca52de4d0b082590895113","observation_id":"0059c88e-67a8-44e5-8b93-f28fe50fbd48","resolution":{"observed_at":"2026-08-02T03:31:45.138426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.237571Z","title":"Merlin: A vision language foundation model for 3d computed tomography.Research Square, pages rs–3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.237571Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:43b000ccd6aa537f6a612875a7969a0bdca2c9c54948504ba2f069ea789d5701","observation_id":"a1d69e37-07d8-429f-8c4c-e9a05483c24c","resolution":{"observed_at":"2026-08-02T03:31:45.237571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.318993Z","title":"Vista3d: A unified segmentation foundation model for 3d medical imaging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.318993Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:25140bcb12306d20dbbb032f6918f73e9266f982cb50d5dea6b122da95574f1c","observation_id":"b163727a-28b8-4426-9523-8c3f16c3970f","resolution":{"observed_at":"2026-08-02T03:31:45.318993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-18T17:14:44.330300Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-02T03:31:45.407270Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.407270Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:4ed3747e9f2432bd318b55d838a929c25a00eebd57de86aa7f92f93a16636b96","observation_id":"fa7b3241-1b38-45b5-9007-bddae5600c32","resolution":{"observed_at":"2026-08-02T03:31:45.407270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.499932Z","title":"Segment anything model for medical image analysis: an experimental study.Medical Image Analysis, 89:102918, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.499932Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:04677d5cc8192e7c35366ba0f96d7858338126479bf47297667635900a29de86","observation_id":"75257ee6-a858-4954-a8d9-40679d21f852","resolution":{"observed_at":"2026-08-02T03:31:45.499932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.584854Z","title":"Med-2e3: A 2d-enhanced 3d medical multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.584854Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:a91e38a0121cfe3b04484686fe799c4ac6806c85172c989540613d1160164f71","observation_id":"0b272eb8-299f-4bfd-8275-5d1e0a24dd1c","resolution":{"observed_at":"2026-08-02T03:31:45.584854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13800","last_updated":"2026-07-16T07:01:10Z","snapshot_observed_at":"2026-08-17T15:41:04.795517Z","submitted_at":"2026-03-14T07:17:45Z","title":"Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.13800","snapshot_observed_at":"2026-08-02T03:31:45.670345Z","title":"Beyond medical diagnostics: How medical multimodal large language models think in space.arXiv preprint arXiv:2603.13800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.670345Z"},"links":{"cited_paper":"/paper/2603.13800","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:d8b63e451372caa029f3a22d2a7fd7fb94de8c0bd29eba4c2214c08e0c973ee1","observation_id":"9915882e-1343-4c71-a4bc-08de70340285","resolution":{"observed_at":"2026-08-02T03:31:45.670345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.765710Z","title":"3drea- sonknee: Advancing grounded reasoning in medical vision language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.765710Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:848d56b159006e417af394e1022137256b636f41ffb8952a633c9ab0eb833695","observation_id":"d4661130-2d92-4ac6-adc8-fe462967db46","resolution":{"observed_at":"2026-08-02T03:31:45.765710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-02T03:31:45.883249Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey.arXiv preprint arXiv:2503.12605, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.883249Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:8291d6ac9a30576ed414090495097d3e217da9ae6ea78863be28bfdf0806486b","observation_id":"cc45c55d-b14b-4804-80ff-2a55b130ebe2","resolution":{"observed_at":"2026-08-02T03:31:45.883249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:45.970715Z","title":"Clincot: Clinical-aware visual chain-of-thought for medical vision language models.arXiv preprint arXiv:2603.01124, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.970715Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:df0cf738f54ed3131c4a2b9cb41e32ede817a2cf4618aa002195f41d2412b3d8","observation_id":"b7fa6f94-9359-494f-88ce-26fecae8243a","resolution":{"observed_at":"2026-08-02T03:31:45.970715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04521","last_updated":"2024-10-06T15:28:48Z","snapshot_observed_at":"2026-08-18T18:19:23.470747Z","submitted_at":"2024-10-06T15:28:48Z","title":"MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04521","snapshot_observed_at":"2026-08-02T03:31:46.063749Z","title":"Mc-cot: A modular collaborative cot framework for zero-shot medical-vqa with llm and mllm integration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.063749Z"},"links":{"cited_paper":"/paper/2410.04521","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:7bf43511cfc22d20e3709291ff4de9dfdd191727e7c9a66b8894a68996b36f8b","observation_id":"06f0b4fd-a254-4b40-9908-911f8fe622d0","resolution":{"observed_at":"2026-08-02T03:31:46.063749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:46.178439Z","title":"Fleming-r1: Toward expert-level medical reasoning via reinforcement learning.arXiv preprint arXiv:2509.15279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.178439Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:113b64d8eb9be0ba707917bf5134fc14fdd5d8f0b8bebe721b9a0cb4d614067c","observation_id":"24709653-7253-48d1-a1d7-a865ff206ef4","resolution":{"observed_at":"2026-08-02T03:31:46.178439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08758","last_updated":"2026-06-29T18:48:00Z","snapshot_observed_at":"2026-08-15T01:23:27.360746Z","submitted_at":"2026-01-13T17:42:27Z","title":"M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08758","snapshot_observed_at":"2026-08-02T03:31:46.247505Z","title":"M3cotbench: Benchmark chain-of-thought of mllms in medical image understanding.arXiv preprint arXiv:2601.08758, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.247505Z"},"links":{"cited_paper":"/paper/2601.08758","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:6f9d30f8a889b5b65ba936425e7ecc87fb5f72de06cefaa651cf55865a367a00","observation_id":"05c76035-8541-40be-920d-cac4cd983fd7","resolution":{"observed_at":"2026-08-02T03:31:46.247505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11740","last_updated":"2026-06-10T07:16:27Z","snapshot_observed_at":"2026-08-02T02:17:16.809620Z","submitted_at":"2026-06-10T07:16:27Z","title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11740","snapshot_observed_at":"2026-08-02T03:31:46.323285Z","title":"Unireason-med: A shared grounded rea- soning interface for 2d-to-3d transfer in medical vqa.arXiv preprint arXiv:2606.11740, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.323285Z"},"links":{"cited_paper":"/paper/2606.11740","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:aa1bc38f6620772a2ac33838819522824f0aa698c7251a689e2d4e9f8c6f6f5d","observation_id":"c72ffd40-0803-43a2-80dc-e493465d50f7","resolution":{"observed_at":"2026-08-02T03:31:46.323285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-02T03:31:46.403528Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.403528Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:aea58d1e72895e5a0d27ff514af542649e4ecf7e9203c85667a7372cf3b11baa","observation_id":"d4fbc204-770b-4f7d-8a80-f4f86b9f6505","resolution":{"observed_at":"2026-08-02T03:31:46.403528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:46.512487Z","title":"Med3dvlm: An efficient vision-language model for 3d medical image analysis.IEEE Journal of Biomedical and Health Informatics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.512487Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:da32852cdaa1c80d1dafcedef54d3eada2db206cb25186ab722a4b578b060f25","observation_id":"cbf21206-f406-4fb3-a438-b62ba33dd1b4","resolution":{"observed_at":"2026-08-02T03:31:46.512487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:46.596186Z","title":"Medcot: Medical chain of thought via hierarchical expert","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.596186Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:c63230b5fe973a1c0637135bdaeee42a27139c1985459852015ee5eb48e8f069","observation_id":"22a045f0-29d7-45a5-bf8e-397a7bd07123","resolution":{"observed_at":"2026-08-02T03:31:46.596186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-08-19T01:23:57.151803Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08035","snapshot_observed_at":"2026-08-02T03:31:46.679205Z","title":"Dyco-rl: Dynamic cross-modal coordination for visual reasoning.arXiv preprint arXiv:2606.08035, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.679205Z"},"links":{"cited_paper":"/paper/2606.08035","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:98ad4d5eb8cfbc93f1dfb5df5515578a802c4fd9771b38b1542dc777296f958b","observation_id":"d320dcc6-4118-4dc5-b9f3-1d40a5ed7a78","resolution":{"observed_at":"2026-08-02T03:31:46.679205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-02T03:31:46.762281Z","title":"Pmc-vqa: Visual instruction tun- ing for medical visual question answering, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.762281Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:591ccc8852b96137fc31381648c0a03992574d1fd0cf2a72b0647efe76cd1a6c","observation_id":"c5161ce8-2d2f-462e-a7c4-7dec4f5627e9","resolution":{"observed_at":"2026-08-02T03:31:46.762281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02900","last_updated":"2025-07-10T08:33:52Z","snapshot_observed_at":"2026-08-18T16:54:45.587374Z","submitted_at":"2024-08-06T02:09:35Z","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02900","snapshot_observed_at":"2026-08-02T03:31:46.899960Z","title":"Medtrinity- 25m: A large-scale multimodal dataset with multigranular annotations for medicine.arXiv preprint arXiv:2408.02900, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.899960Z"},"links":{"cited_paper":"/paper/2408.02900","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:988920aef6687a532b0bab4e367a3e0ecf7c5d482b8dc0412189767661c2a56c","observation_id":"8cce3545-dddb-481e-a310-bfd55eb920c7","resolution":{"observed_at":"2026-08-02T03:31:46.899960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:47.077759Z","title":"Biomedical visual instruction tuning with clinician preference alignment.Advances in neural information processing systems, 37:96449–96467, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:47.077759Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:1f6f1866be1231e59a2ca26196d5f87935415fb22e788085e37f0f8214047830","observation_id":"bf5872a5-ac9e-4c88-ae88-af2952921345","resolution":{"observed_at":"2026-08-02T03:31:47.077759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:47.215517Z","title":"Towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:47.215517Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:9297e21ad74a8406afbf0139f705d0fdb9e2328a8bcab0753a511845dab493ac","observation_id":"5d8d5b48-a4b8-4816-b62b-0db0ba23b7ca","resolution":{"observed_at":"2026-08-02T03:31:47.215517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16754","last_updated":"2024-04-25T17:11:37Z","snapshot_observed_at":"2026-08-17T16:25:56.941516Z","submitted_at":"2024-04-25T17:11:37Z","title":"RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16754","snapshot_observed_at":"2026-08-02T03:31:47.359351Z","title":"Radgenome-chest ct: A grounded vision- language dataset for chest ct analysis.arXiv preprint arXiv:2404.16754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:47.359351Z"},"links":{"cited_paper":"/paper/2404.16754","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:5087c55ab4e6c46a104ba1d350740597c3dcb3d631c449ad4e3b384390ecf3ef","observation_id":"03960680-663c-4ff2-a18a-2159370e0e6d","resolution":{"observed_at":"2026-08-02T03:31:47.359351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:31:47.529613Z","title":"Terrascope: Pixel-grounded visual reasoning for earth observation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:47.529613Z"},"links":{"citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:a84df9b4ecadd961d3956d77317f4df59824f358678fa8e876f4e6e81677d9bb","observation_id":"2dcba384-37eb-4a1b-9390-6f12b9dc6166","resolution":{"observed_at":"2026-08-02T03:31:47.529613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:09:29.952865Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.13860."}