{"as_of":"2026-08-15T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da653afc283dd0674ad92302f7e99eef3cccee27d15d410226c95e3a7dd2fc6e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":84,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:59:33.495030Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":16,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-12T18:42:17.663360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11362","last_updated":"2024-11-18T08:13:22Z","snapshot_observed_at":"2026-08-15T15:40:04.342532Z","submitted_at":"2024-11-18T08:13:22Z","title":"MAIRA-Seg: Enhancing Radiology Report Generation with Segmentation-Aware Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:42:17.663360Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2411.11362"},"observation_digest":"sha256:a1d267cf549f73a7521053c7d941d4bb216687e67cc9b20771e48649caefba5a","observation_id":"f184404e-2b64-4587-83fb-ee63fc83351c","resolution":{"observed_at":"2026-08-12T18:42:17.663360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-12T14:15:55.972678Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15539","last_updated":"2025-05-05T02:18:33Z","snapshot_observed_at":"2026-08-15T08:07:05.071465Z","submitted_at":"2024-11-23T12:25:06Z","title":"Large Language Model with Region-guided Referring and Grounding for CT Report Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:15:55.972678Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2411.15539"},"observation_digest":"sha256:47d2e5c28b65f7617798477224608b6571da784f8a41f92ff110ad98622d4711","observation_id":"0df6d565-e58a-4be5-a0b9-3d01336fa0a3","resolution":{"observed_at":"2026-08-12T14:15:55.972678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-11T20:21:00.016626Z","title":"M3D: Advancing 3D Medical Image Anal- ysis with Multi-Modal Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05876","last_updated":"2024-12-08T09:45:59Z","snapshot_observed_at":"2026-08-12T21:27:27.045329Z","submitted_at":"2024-12-08T09:45:59Z","title":"MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:21:00.016626Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2412.05876"},"observation_digest":"sha256:e9dad4f8050639f81f3028a5af68b3f1f7ca224edf0b202a43a4c8a933457651","observation_id":"4266b35d-f31e-4f48-b8ca-ed32fb35b455","resolution":{"observed_at":"2026-08-11T20:21:00.016626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-11T14:43:41.768579Z","title":"In 2021 IEEE/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10-17, 2021, pages 6816–6826","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11694","last_updated":"2025-03-04T01:47:20Z","snapshot_observed_at":"2026-08-15T09:36:57.570538Z","submitted_at":"2024-12-16T12:12:45Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T14:43:41.768579Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2412.11694"},"observation_digest":"sha256:912aeffe50d892054949264f43fb157d94d9a43e864fa49327a27ec4e045201e","observation_id":"e14dedcb-cd1d-49fe-9acf-919d218b88b4","resolution":{"observed_at":"2026-08-11T14:43:41.768579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-11T13:03:53.081260Z","title":"arXiv preprint arXiv:2404.00578","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13558","last_updated":"2024-12-18T07:19:48Z","snapshot_observed_at":"2026-08-15T08:07:05.889749Z","submitted_at":"2024-12-18T07:19:48Z","title":"Read Like a Radiologist: Efficient Vision-Language Model for 3D Medical Imaging Interpretation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T13:03:53.081260Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2412.13558"},"observation_digest":"sha256:a4823d899b39268a4a011da7234cc8e7ce23e4676ebb1146e7cd2a08c4a2337e","observation_id":"bd1a39e1-ef5d-4104-a2bd-d47a6d4d4e11","resolution":{"observed_at":"2026-08-11T13:03:53.081260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-11T11:54:12.097240Z","title":"Q.-H.; and Zhao, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14837","last_updated":"2024-12-19T13:27:58Z","snapshot_observed_at":"2026-08-14T06:16:11.776146Z","submitted_at":"2024-12-19T13:27:58Z","title":"ObjVariantEnsemble: Advancing Point Cloud LLM Evaluation in Challenging Scenes with Subtly Distinguished Objects","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:54:12.097240Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2412.14837"},"observation_digest":"sha256:a01dddfc5257bdc650d984399606cc866bf4151a810c213ed9f676057eacce64","observation_id":"7cb83e7c-f1bd-4cc5-81ab-ee7c9947bc7a","resolution":{"observed_at":"2026-08-11T11:54:12.097240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-10T21:31:28.402503Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04678","last_updated":"2025-08-19T17:05:14Z","snapshot_observed_at":"2026-08-14T17:31:45.154107Z","submitted_at":"2025-01-08T18:39:10Z","title":"RadGPT: Constructing 3D Image-Text Tumor Datasets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:28.402503Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2501.04678"},"observation_digest":"sha256:4681c26df736e40bd1b12f49e93f0bd7c06f43770a03df6c1b33783dd91c717f","observation_id":"68ba6cf1-c3d4-4c02-9d24-eeddc0dce09d","resolution":{"observed_at":"2026-08-10T21:31:28.402503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-09T17:36:27.848303Z","title":"CoRR abs/2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00832","last_updated":"2025-02-02T16:05:23Z","snapshot_observed_at":"2026-08-14T23:29:48.333652Z","submitted_at":"2025-02-02T16:05:23Z","title":"Generalization of Medical Large Language Models through Cross-Domain Weak Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:27.848303Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2502.00832"},"observation_digest":"sha256:e8393ae901215a5ddb23111125d052487023dfca785d83d8536f1ebd6a71d864","observation_id":"9c44e8e2-4920-4a7b-867d-393199847498","resolution":{"observed_at":"2026-08-09T17:36:27.848303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T22:13:31.441167Z","title":"arXiv preprint arXiv:2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09242","last_updated":"2025-02-13T11:57:51Z","snapshot_observed_at":"2026-08-15T22:00:31.853538Z","submitted_at":"2025-02-13T11:57:51Z","title":"From large language models to multimodal AI: A scoping review on the potential of generative AI in medicine","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-07T22:13:31.441167Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2502.09242"},"observation_digest":"sha256:3872e1863b3cde6c17d3f706bc1f6cc83142f5ffdf885d287e3f77ec6adf09bb","observation_id":"b1d6dc9e-ab59-4121-b2a5-e9048a3241bf","resolution":{"observed_at":"2026-08-07T22:13:31.441167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T21:59:33.495030Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-15T21:52:17.078051Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.495030Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c1f3b60f0fc8ad017e086b9dd23ee440a184dad929a569d330d489201920293f","observation_id":"81b998e8-84cd-4ebd-82ad-3ab02563bc02","resolution":{"observed_at":"2026-08-15T21:59:33.495030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T21:43:30.669345Z","title":", author Du, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09178","last_updated":"2025-05-15T12:49:27Z","snapshot_observed_at":"2026-08-15T21:35:35.754522Z","submitted_at":"2025-05-14T06:21:27Z","title":"UniCAD: Efficient and Extendable Architecture for Multi-Task Computer-Aided Diagnosis System","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:43:30.669345Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.09178"},"observation_digest":"sha256:3eaf3b9db0de23a3d6f6e51ab265f9eb25e4ab1cabce9ccf4add5fc7f5d81054","observation_id":"302528a7-045a-4bef-b088-bff4db262e57","resolution":{"observed_at":"2026-08-15T21:43:30.669345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T15:08:28.332256Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16229","last_updated":"2025-05-22T04:59:20Z","snapshot_observed_at":"2026-08-13T16:09:05.527401Z","submitted_at":"2025-05-22T04:59:20Z","title":"CT-Agent: A Multimodal-LLM Agent for 3D CT Radiology Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:28.332256Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.16229"},"observation_digest":"sha256:e02137a261de81cc774063f9862f07ca54b904171546103fa6075877a1717666","observation_id":"7d745b69-d3cf-4a0f-9d48-b46624b1e27f","resolution":{"observed_at":"2026-08-07T15:08:28.332256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T14:26:28.812740Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-13T15:43:52.209016Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.812740Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:09a8f0e26f7ffc7417d72eb44e268ff641c067dc021390d6ee9ee25f86d70be0","observation_id":"80578d81-f810-4025-a65d-6a6b47436b5f","resolution":{"observed_at":"2026-08-07T14:26:28.812740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T14:24:10.371955Z","title":"arXiv preprint arXiv:2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19031","last_updated":"2025-05-25T08:31:22Z","snapshot_observed_at":"2026-08-14T22:20:56.944483Z","submitted_at":"2025-05-25T08:31:22Z","title":"Medical Large Vision Language Models with Multi-Image Visual Ability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:10.371955Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.19031"},"observation_digest":"sha256:9ab6d6a881c74c4f0b13a0b1ac162d4d74641d1f2fd7af21c05c9d805aea100d","observation_id":"5d681346-a2ad-4700-910d-eed18fd9a76b","resolution":{"observed_at":"2026-08-07T14:24:10.371955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T04:47:07.628602Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.628602Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:a462bafc30ec843344cf4159b23f158baf71f8d4b84a613077c15c8ebb463926","observation_id":"7a954a7c-d5a8-4442-ba12-c67648decd15","resolution":{"observed_at":"2026-08-07T04:47:07.628602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T20:10:52.036790Z","title":"What visual observation can be made in this picture?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12849","last_updated":"2025-06-15T13:42:46Z","snapshot_observed_at":"2026-08-15T20:03:51.084733Z","submitted_at":"2025-06-15T13:42:46Z","title":"CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:10:52.036790Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.12849"},"observation_digest":"sha256:d71997dda4f518e1a8699a0727686ed67f2365a5f603aabe04cf2d9026859302","observation_id":"8ce087ba-5932-4f0f-b9eb-e4043082d566","resolution":{"observed_at":"2026-08-15T20:10:52.036790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T00:39:42.343862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":185,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.343862Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:139c0d5dbeac1dfcf24ef2a698ffb4c0dfa04cdfda560160581c0aff00e28c24","observation_id":"0b4e8ea3-63f2-4cec-96ff-fcc70fa5150d","resolution":{"observed_at":"2026-08-07T00:39:42.343862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T23:10:45.988146Z","title":"Meng, and Bo Zhao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19217","last_updated":"2025-06-24T00:51:03Z","snapshot_observed_at":"2026-08-09T19:22:27.267511Z","submitted_at":"2025-06-24T00:51:03Z","title":"MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:10:45.988146Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.19217"},"observation_digest":"sha256:a518840fa2486567d90ffcd8fca61cf25ef69acdd347d4649de28d0606dbf78b","observation_id":"470dc869-5bc2-4946-ac5e-dde649d80ed8","resolution":{"observed_at":"2026-08-06T23:10:45.988146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T18:32:12.203692Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19665","last_updated":"2025-06-24T14:29:06Z","snapshot_observed_at":"2026-08-15T18:26:18.611069Z","submitted_at":"2025-06-24T14:29:06Z","title":"Recurrent Visual Feature Extraction and Stereo Attentions for CT Report Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:32:12.203692Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.19665"},"observation_digest":"sha256:b2f3334945597cd2622f6bd07317eace988b361f8535df6d717b14d17024cf7c","observation_id":"798aebe8-d62b-4fb3-a650-7e1e5543e530","resolution":{"observed_at":"2026-08-15T18:32:12.203692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T21:55:45.574493Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23102","last_updated":"2026-07-06T06:04:13Z","snapshot_observed_at":"2026-08-14T13:40:48.492640Z","submitted_at":"2025-06-29T06:08:55Z","title":"Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:55:45.574493Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.23102"},"observation_digest":"sha256:cbd4c6be2dfdb2e2fae868adc8fa610bf3baa4340dfd46b8341324b67854338a","observation_id":"3ec38a6d-29f8-4b41-ae3e-40ac27ff54f7","resolution":{"observed_at":"2026-08-06T21:55:45.574493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T21:53:29.391871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23121","last_updated":"2025-07-14T02:03:48Z","snapshot_observed_at":"2026-08-14T12:41:25.742606Z","submitted_at":"2025-06-29T07:05:27Z","title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:29.391871Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.23121"},"observation_digest":"sha256:82b348085fd7ef116328cbda98e8c441c1d2b816af90cd76a00cefc256003b17","observation_id":"0ae81d1b-914f-41bd-894c-5e888dec489c","resolution":{"observed_at":"2026-08-06T21:53:29.391871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T22:02:25.661416Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01055","last_updated":"2025-06-28T03:06:25Z","snapshot_observed_at":"2026-08-13T10:44:18.994692Z","submitted_at":"2025-06-28T03:06:25Z","title":"Prompt Mechanisms in Medical Imaging: A Comprehensive Survey","version":1},"reference_index":198,"source":"pdf_text","source_observed_at":"2026-08-06T22:02:25.661416Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.01055"},"observation_digest":"sha256:19455c8325af2d875cd6a419873cecf462bfadea9a847bdbb3f5c49f0982e3c8","observation_id":"85e4cc4c-d148-4b74-ae54-7312b2313783","resolution":{"observed_at":"2026-08-06T22:02:25.661416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T21:04:54.657204Z","title":"arXiv preprint arXiv:2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02994","last_updated":"2025-07-01T21:51:42Z","snapshot_observed_at":"2026-08-14T14:57:46.308209Z","submitted_at":"2025-07-01T21:51:42Z","title":"MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:04:54.657204Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.02994"},"observation_digest":"sha256:21b88ee00f860a638728cb83b056f45d3fcb10ecd69093beafcfff4e97080336","observation_id":"26534c7d-5826-4238-84f1-39e4d1a7b55a","resolution":{"observed_at":"2026-08-06T21:04:54.657204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T19:54:39.777120Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-13T09:11:04.552012Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.777120Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:9de8348c373d588498dcf6d62e3bb6d787788798878c2c67d95df15cde7becbb","observation_id":"e3ea3aeb-2a9b-4ddc-9717-3d168e17b137","resolution":{"observed_at":"2026-08-06T19:54:39.777120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T18:06:23.568402Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09209","last_updated":"2025-07-12T09:03:30Z","snapshot_observed_at":"2026-08-14T15:19:08.265341Z","submitted_at":"2025-07-12T09:03:30Z","title":"Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:06:23.568402Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.09209"},"observation_digest":"sha256:9cee5292295ea5bde3ea0785a99ba5d03fea9be8a33240495893ecca356ba55f","observation_id":"3827a0b4-4f05-43e1-a11f-de13308982b9","resolution":{"observed_at":"2026-08-06T18:06:23.568402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T16:42:18.939180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12774","last_updated":"2025-07-17T04:31:55Z","snapshot_observed_at":"2026-08-14T01:04:48.483410Z","submitted_at":"2025-07-17T04:31:55Z","title":"A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:18.939180Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.12774"},"observation_digest":"sha256:9423a4273aa6dc1a56025d9e3d3a78358e32a14126ee57dc6c12a04ee98412e1","observation_id":"4d1a4189-a266-44f6-bd16-250cd314af5f","resolution":{"observed_at":"2026-08-06T16:42:18.939180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T16:39:48.004934Z","title":"arXiv preprint arXiv:2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12945","last_updated":"2025-07-17T09:34:21Z","snapshot_observed_at":"2026-08-14T04:02:38.594415Z","submitted_at":"2025-07-17T09:34:21Z","title":"Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardiac MR-Based Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:48.004934Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.12945"},"observation_digest":"sha256:d91963eeeea055708621a81d8c5ff154cac6bc4304833ebf6984ebcd53d9777f","observation_id":"429a6ed5-dac3-4571-ae83-b392dadae28f","resolution":{"observed_at":"2026-08-06T16:39:48.004934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T12:12:57.424476Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22024","last_updated":"2025-07-29T17:20:32Z","snapshot_observed_at":"2026-08-14T05:05:10.883164Z","submitted_at":"2025-07-29T17:20:32Z","title":"Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:12:57.424476Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.22024"},"observation_digest":"sha256:070a7716a350a3e79111d2883b0cde0cc8d0d855b84a2bd23398774a690a03f5","observation_id":"ac148cf1-fe75-4dd7-9fa9-ff26107f2d1a","resolution":{"observed_at":"2026-08-06T12:12:57.424476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T23:25:36.790483Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05379","last_updated":"2025-08-07T13:24:54Z","snapshot_observed_at":"2026-08-15T16:49:47.906929Z","submitted_at":"2025-08-07T13:24:54Z","title":"Disorder-induced stress-flow misalignment in soft glassy materials revealed using multi-directional shear","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:25:36.790483Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2508.05379"},"observation_digest":"sha256:dcfc5345d7af2818f6db7057220667db182764887abaefe22515a1a2eaa1986d","observation_id":"5569499f-13f0-42fd-ab8f-8d331e38777e","resolution":{"observed_at":"2026-08-05T23:25:36.790483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T17:30:00.948324Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.948324Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:37341cdacf6eddb64e8ea8f6d2b1a2a379242188ad913701a9303a39272ecafe","observation_id":"1c8df07b-4282-4af2-aa22-24f49dff84f6","resolution":{"observed_at":"2026-08-15T17:30:00.948324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T12:29:50.230776Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.230776Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:53d347e8b9da126878fb804f7f6eea25cd1016035cd710d28cf8129a378a0fd9","observation_id":"c9f01c67-46b2-4be2-8c81-5e915db4d451","resolution":{"observed_at":"2026-08-05T12:29:50.230776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T13:29:52.943085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04480","last_updated":"2025-08-30T23:47:17Z","snapshot_observed_at":"2026-08-08T13:39:58.919865Z","submitted_at":"2025-08-30T23:47:17Z","title":"Discrete Prompt Tuning via Recursive Utilization of Black-box Multimodal Large Language Model for Personalized Visual Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:29:52.943085Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.04480"},"observation_digest":"sha256:ea64be36c51882dd87e8e8301f6c8e9acc25da3d6f1070074cbe566d52907865","observation_id":"148242bc-beaf-4689-a852-a917e615e22d","resolution":{"observed_at":"2026-08-05T13:29:52.943085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T20:51:06.573174Z","title":"arXiv preprint arXiv:2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08311","last_updated":"2025-09-10T06:20:53Z","snapshot_observed_at":"2026-08-07T20:54:58.147463Z","submitted_at":"2025-09-10T06:20:53Z","title":"SimCroP: Radiograph Representation Learning with Similarity-driven Cross-granularity Pre-training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:51:06.573174Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.08311"},"observation_digest":"sha256:730f45b082c16b99342f8435be2c1d317ae42e113158aab8ed8b09747013cd24","observation_id":"6aba8ddf-b582-48be-b877-5da0a05f5a3d","resolution":{"observed_at":"2026-08-04T20:51:06.573174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T19:48:40.847417Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09064","last_updated":"2025-09-11T00:12:59Z","snapshot_observed_at":"2026-08-08T21:56:46.677679Z","submitted_at":"2025-09-11T00:12:59Z","title":"Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:40.847417Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.09064"},"observation_digest":"sha256:5b7144c312566e160da6f75c5021b11371da8b6eb6210548be9c5e6cc9ef9340","observation_id":"e3004081-6425-4a0d-ae43-e085ed86ab35","resolution":{"observed_at":"2026-08-04T19:48:40.847417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T20:33:33.091166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09730","last_updated":"2025-09-10T12:07:34Z","snapshot_observed_at":"2026-08-06T06:00:54.696736Z","submitted_at":"2025-09-10T12:07:34Z","title":"MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:33:33.091166Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.09730"},"observation_digest":"sha256:069501b69bf417a9d05f716475ff8eea5311d1f2ed0f2d3259104f108ec183c0","observation_id":"d6dd44cf-da80-4248-986b-23d2752283de","resolution":{"observed_at":"2026-08-04T20:33:33.091166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T13:51:50.397726Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-13T16:21:39.535655Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:50.397726Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:334416f9caba17e0da347762d896b7ee87bce9584088df06c7a2ff2c1947d10c","observation_id":"005877fd-9168-4760-b693-704595f14130","resolution":{"observed_at":"2026-08-04T13:51:50.397726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2601.03054","last_updated":"2026-04-07T14:46:22Z","snapshot_observed_at":"2026-07-31T17:41:45.462465Z","submitted_at":"2026-01-06T14:37:50Z","title":"IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T17:31:33.903063Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2601.03054"},"observation_digest":"sha256:f1f1a33ab5f07c4bc73160815497e29f2f5a667c7189739d889e54fb997e0a3d","observation_id":"fe6b51a2-07cb-4b1c-b50b-ffbe728f3d2e","resolution":{"observed_at":"2026-05-16T17:33:10.136009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-02T18:16:31.288447Z","title":"Q.-H., and Zhao, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.13800","last_updated":"2026-07-16T07:01:10Z","snapshot_observed_at":"2026-08-15T01:37:58.723147Z","submitted_at":"2026-03-14T07:17:45Z","title":"Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T18:16:31.288447Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2603.13800"},"observation_digest":"sha256:796f7031c5bfe524593387a2a360af9cac79abcc2c02fcba85f2cbd4fc380006","observation_id":"bd8a8576-6537-45f3-ae60-098771088330","resolution":{"observed_at":"2026-08-02T18:16:31.288447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-14T21:05:40.877444Z","title":"arXiv preprint arXiv:2404.00578 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14579","last_updated":"2026-06-29T21:06:58Z","snapshot_observed_at":"2026-08-15T02:10:29.210382Z","submitted_at":"2026-03-15T19:54:46Z","title":"Medical Image Spatial Grounding with Semantic Sampling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T21:05:40.877444Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2603.14579"},"observation_digest":"sha256:1b2ec2da88b5a7083625233e1f2a5f66bd0c1acf136acfa1793bf23831745f33","observation_id":"3f6ea956-afc8-4a51-acc3-c0eb28d0c475","resolution":{"observed_at":"2026-07-14T21:05:40.877444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-13T23:01:41.380237Z","title":"arXiv preprint arXiv:2404.00578 (2024) 16 Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.17717","last_updated":"2026-07-10T17:44:24Z","snapshot_observed_at":"2026-08-03T16:40:40.755363Z","submitted_at":"2026-03-18T13:35:02Z","title":"Machine Learning for Network Attacks Classification and Statistical Evaluation of Adversarial Learning Methodologies for Synthetic Data Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T23:01:41.380237Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2603.17717"},"observation_digest":"sha256:35f04db1551728440ac48171c2336497485951022951ce4ab9de989da27f798d","observation_id":"48436c65-7b87-48aa-a06b-56a5ae0b7220","resolution":{"observed_at":"2026-07-13T23:01:41.380237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.02748","last_updated":"2026-04-03T05:39:47Z","snapshot_observed_at":"2026-08-14T12:27:31.970187Z","submitted_at":"2026-04-03T05:39:47Z","title":"Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:39:11.270334Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.02748"},"observation_digest":"sha256:d75e3bba5a997b2b29fbe365058564e728a7c34638519b329bea433bb44b64fd","observation_id":"4a339af0-f232-449c-bfe7-6bf03b6ac85a","resolution":{"observed_at":"2026-05-13T20:43:15.199309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.04133","last_updated":"2026-04-05T14:29:35Z","snapshot_observed_at":"2026-08-15T07:22:49.112366Z","submitted_at":"2026-04-05T14:29:35Z","title":"Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T16:59:24.785428Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.04133"},"observation_digest":"sha256:16c9f68af5d4465034b72c2c5a33b61e8a40318a4aff0adfbca2ad26508cca60","observation_id":"138461d1-9c0c-4b30-9c66-22adfc8bbb42","resolution":{"observed_at":"2026-05-13T17:03:00.237995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-13T08:51:32.030725Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:19fdd304c9886f1e8d54fe2ce6204391e0ccbd7d6b85706eb8c17abb93fe6ec1","observation_id":"cb2eda88-b33c-444e-ba19-e771842c9bfd","resolution":{"observed_at":"2026-05-11T08:20:58.323661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.13021","last_updated":"2026-04-14T17:56:23Z","snapshot_observed_at":"2026-08-13T01:10:36.924378Z","submitted_at":"2026-04-14T17:56:23Z","title":"Representation geometry shapes task performance in vision-language modeling for CT enterography","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:30.757910Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.13021"},"observation_digest":"sha256:089d0abbdbefce3755d248114e29ee985655335166ed7c081905b759c6f5dd77","observation_id":"86fcf4aa-8ba2-4b64-8b48-0db5b84b8ff9","resolution":{"observed_at":"2026-05-11T09:41:02.482725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.15231","last_updated":"2026-06-01T09:42:47Z","snapshot_observed_at":"2026-08-12T21:12:18.120863Z","submitted_at":"2026-04-16T17:09:30Z","title":"RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T10:54:35.000783Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.15231"},"observation_digest":"sha256:270072e5d07e33383fd2eb38cb5786adc3d996859f3d564fc5d57a5d0d2a33de","observation_id":"a46b70fe-bfd3-4dbb-ac7c-b72bff565382","resolution":{"observed_at":"2026-05-10T10:55:03.876696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-12T19:46:06.596310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.15231","last_updated":"2026-06-01T09:42:47Z","snapshot_observed_at":"2026-08-12T21:12:18.120863Z","submitted_at":"2026-04-16T17:09:30Z","title":"RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T19:46:06.596310Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.15231"},"observation_digest":"sha256:86bd6ffd61b79faf2d98d151b238135123262e3671fd907dbb24e220a0dd77d6","observation_id":"9d036104-0408-4a7d-9184-2671cf3fd640","resolution":{"observed_at":"2026-07-12T19:46:06.596310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.16729","last_updated":"2026-04-17T22:04:16Z","snapshot_observed_at":"2026-08-13T22:07:17.745295Z","submitted_at":"2026-04-17T22:04:16Z","title":"Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:25:57.646822Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.16729"},"observation_digest":"sha256:1773b66a39a4a178c44810779f271b7eafd3cf95efc8acb8780561b8941e8bc6","observation_id":"7506e170-b439-4c9d-90ed-1800a6e1e08a","resolution":{"observed_at":"2026-05-10T08:27:51.878808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.01779","last_updated":"2026-05-03T08:32:40Z","snapshot_observed_at":"2026-08-11T15:34:12.035220Z","submitted_at":"2026-05-03T08:32:40Z","title":"MedScribe: Clinically Grounded CT Reporting through Agentic Workflows","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T19:22:09.493354Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.01779"},"observation_digest":"sha256:cc6ff37a22c056e8c4cf6956c290a4a85f8eab96a5a83ec537def37bd8915189","observation_id":"770f8a69-294e-4fd9-82e1-1ea0c6d32b50","resolution":{"observed_at":"2026-05-09T05:55:31.001916Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.05810","last_updated":"2026-05-07T07:46:17Z","snapshot_observed_at":"2026-08-13T03:46:16.237648Z","submitted_at":"2026-05-07T07:46:17Z","title":"CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T14:49:53.357083Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.05810"},"observation_digest":"sha256:0cb0ac376569a4439f490318c47d15b50348575945852922f94c5e3cfff462aa","observation_id":"44219f25-ef43-45c8-b1d2-95882c382539","resolution":{"observed_at":"2026-05-11T18:41:09.638022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.08787","last_updated":"2026-06-19T11:21:43Z","snapshot_observed_at":"2026-08-14T08:00:09.299101Z","submitted_at":"2026-05-09T08:16:00Z","title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:31:41.805037Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.08787"},"observation_digest":"sha256:69c3249b4e93bbbe8802dcfac1efbe3896e3ea3820bc94080f33a31da1451129","observation_id":"d3d81bc0-3430-4360-8cc9-34c57dae9ada","resolution":{"observed_at":"2026-05-12T07:56:27.075904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.08787","last_updated":"2026-06-19T11:21:43Z","snapshot_observed_at":"2026-08-14T08:00:09.299101Z","submitted_at":"2026-05-09T08:16:00Z","title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T23:19:20.522732Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.08787"},"observation_digest":"sha256:371356fdbfd1e816e16a568ae6e5618a5bfb9660e8b4026c37379e8fbb7b2f43","observation_id":"d85bdc3c-c26b-417b-b411-e0023f455b7e","resolution":{"observed_at":"2026-07-01T13:25:45.163252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.09679","last_updated":"2026-05-10T17:57:57Z","snapshot_observed_at":"2026-08-15T01:31:33.904319Z","submitted_at":"2026-05-10T17:57:57Z","title":"DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:02:36.159920Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.09679"},"observation_digest":"sha256:0278f3580fbc63010a4b592289c07beb589b9989a068dc6df49dfa4579bed9c6","observation_id":"529e51a5-2359-4a87-b6cd-7304dd5839c8","resolution":{"observed_at":"2026-05-12T06:41:43.481584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.10761","last_updated":"2026-05-11T15:57:35Z","snapshot_observed_at":"2026-08-02T12:12:15.627459Z","submitted_at":"2026-05-11T15:57:35Z","title":"RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:55:55.359488Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.10761"},"observation_digest":"sha256:4d403f4521db9577f1d09ccaf8aef9b1f57b7392f0a9cd3b5670fcd1a1cd9607","observation_id":"22380ac2-6bc9-48f5-af9f-b6797fc2e88d","resolution":{"observed_at":"2026-05-12T03:56:21.475486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.12570","last_updated":"2026-05-12T10:16:41Z","snapshot_observed_at":"2026-08-15T14:20:50.672129Z","submitted_at":"2026-05-12T10:16:41Z","title":"M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:57.769186Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.12570"},"observation_digest":"sha256:60031975f4a500f4e0340ebfa76d7118416621c0ffcd33674ce329c8751f8d02","observation_id":"05262b06-a4d4-4746-ad24-b0d3da38668b","resolution":{"observed_at":"2026-05-14T20:59:27.387088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.13544","last_updated":"2026-07-02T02:24:27Z","snapshot_observed_at":"2026-08-15T04:00:24.627377Z","submitted_at":"2026-05-13T13:54:27Z","title":"CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:57:47.615619Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.13544"},"observation_digest":"sha256:27c883c19f21fa091b9621546a9f49954d59854bffab566722f0147565980258","observation_id":"7fb91275-cba4-4666-9659-b98a272329ea","resolution":{"observed_at":"2026-05-14T19:57:52.874218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.13544","last_updated":"2026-07-02T02:24:27Z","snapshot_observed_at":"2026-08-15T04:00:24.627377Z","submitted_at":"2026-05-13T13:54:27Z","title":"CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-04T01:10:31.958276Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.13544"},"observation_digest":"sha256:75af109013a3bc4060f7d94eb999a100ec22462cfad37db608193ac6887f12bb","observation_id":"ca6b1399-553e-431c-ba0c-540cf4e34249","resolution":{"observed_at":"2026-07-04T01:19:20.424112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-08-15T13:35:21.182735Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:4f3373c8bff9ad17b3a6635592e3928d7dfb2a301d7c21eef42474772de0f64f","observation_id":"9d3c9cbb-ecde-4fb4-a6df-a3eaeb18f26f","resolution":{"observed_at":"2026-05-20T18:23:37.668034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.20277","last_updated":"2026-05-19T04:33:27Z","snapshot_observed_at":"2026-08-15T03:23:29.141078Z","submitted_at":"2026-05-19T04:33:27Z","title":"Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-21T08:06:02.176934Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.20277"},"observation_digest":"sha256:6ce5527cf88be574fafb79b39512212eeffc5e46ebc623ff334dd351c96b8ef2","observation_id":"1ae3aedd-9ba1-4ffd-ab96-2a7b455fcc9c","resolution":{"observed_at":"2026-05-21T08:09:51.827961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.20525","last_updated":"2026-05-19T21:54:12Z","snapshot_observed_at":"2026-07-06T23:31:08.671011Z","submitted_at":"2026-05-19T21:54:12Z","title":"NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T06:54:55.254082Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.20525"},"observation_digest":"sha256:2981031ece7b6d932b62d40a9baa15f32d661de7c2d746846ee79c0b4fab411c","observation_id":"2c03b03f-12fe-4206-b2d3-81676cdeb256","resolution":{"observed_at":"2026-05-21T06:59:45.761587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.21835","last_updated":"2026-05-20T23:59:50Z","snapshot_observed_at":"2026-08-13T22:41:51.108979Z","submitted_at":"2026-05-20T23:59:50Z","title":"An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T07:20:10.061711Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.21835"},"observation_digest":"sha256:684581b23bcf5e5b70f7bb361461b4f6dd9c5239f2a742d00bc372c7744546ce","observation_id":"506a630d-b3a8-4a77-9c5b-3bbbfaea9a63","resolution":{"observed_at":"2026-05-22T07:21:12.683535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.24371","last_updated":"2026-05-23T03:18:56Z","snapshot_observed_at":"2026-08-15T02:37:55.784094Z","submitted_at":"2026-05-23T03:18:56Z","title":"SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:57:09.053990Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.24371"},"observation_digest":"sha256:2f72fcd496fc3f094781852e1a68ab768c61fdb0c6bd3036b5165007e4261141","observation_id":"ec6342dc-bd07-4b37-824a-f33f47af1b31","resolution":{"observed_at":"2026-06-30T14:04:44.781779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.26621","last_updated":"2026-05-26T06:59:19Z","snapshot_observed_at":"2026-08-06T21:00:46.251333Z","submitted_at":"2026-05-26T06:59:19Z","title":"MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:26:10.873395Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.26621"},"observation_digest":"sha256:3f688d8d7f02d8e1b4e848eb96499826804ca22612b042134f93cce16069e9e4","observation_id":"b7c10c63-759f-4782-83d1-4cf296c7de96","resolution":{"observed_at":"2026-06-29T18:33:50.891797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.31437","last_updated":"2026-07-14T04:07:54Z","snapshot_observed_at":"2026-08-12T16:32:16.051417Z","submitted_at":"2026-05-29T15:35:07Z","title":"Astra: a generalizable report generation foundation model for 3D computed tomography","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:12.442334Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.31437"},"observation_digest":"sha256:e9ac11d2a554f45d17e0ad60bc485dc8ec49e6ccd36669382be05c334f87dce4","observation_id":"39b0853b-74e0-4be6-bbfc-bf2773dab466","resolution":{"observed_at":"2026-06-29T00:02:50.405512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.00123","last_updated":"2026-05-28T11:03:06Z","snapshot_observed_at":"2026-08-13T09:01:04.331401Z","submitted_at":"2026-05-28T11:03:06Z","title":"CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T08:28:48.174508Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.00123"},"observation_digest":"sha256:8d944a648066fbbf6dba8ced68f7993d7e4694f55bac5dd5d83001cd8ae85119","observation_id":"71075a4f-7495-4349-a7e9-a8c86250dc02","resolution":{"observed_at":"2026-06-29T08:33:15.355195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.00602","last_updated":"2026-05-30T07:59:21Z","snapshot_observed_at":"2026-08-14T18:26:22.873680Z","submitted_at":"2026-05-30T07:59:21Z","title":"ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T19:16:42.139096Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.00602"},"observation_digest":"sha256:03229855bb4a9b4d44ddd9a8fd9a162d910c3b2d62b25dff7333fcd5d5c93fc6","observation_id":"a0f3b2d1-8329-4eb8-8fb6-8a321e9d304f","resolution":{"observed_at":"2026-06-28T19:22:34.679589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.04365","last_updated":"2026-06-03T02:28:57Z","snapshot_observed_at":"2026-08-12T16:03:03.688035Z","submitted_at":"2026-06-03T02:28:57Z","title":"Multi-Granularity 3D Kidney Lesion Characterization from CT Volumes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T07:06:49.770326Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.04365"},"observation_digest":"sha256:dc64252bc1aca6dd6c773161b0c956330d247bfb36836200b59298e6798e551f","observation_id":"af9e1472-583d-4ac1-a46a-fffed3d884a6","resolution":{"observed_at":"2026-07-02T07:06:44.625727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.11740","last_updated":"2026-06-10T07:16:27Z","snapshot_observed_at":"2026-08-02T02:17:16.809620Z","submitted_at":"2026-06-10T07:16:27Z","title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-06-27T10:21:12.782864Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.11740"},"observation_digest":"sha256:6b853786f42cdb6ff4cfaf51c5ffb107701053663d7aef9a3cfea808da812906","observation_id":"defe729f-ada0-415d-8659-a556e91a25c9","resolution":{"observed_at":"2026-07-03T09:47:59.536498Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.22546","last_updated":"2026-06-23T09:13:27Z","snapshot_observed_at":"2026-08-12T16:31:31.217876Z","submitted_at":"2026-06-21T15:06:45Z","title":"Venice-H1: Failure-Aware Query Re-Ranking with Multi-Scale Grid Signatures for Referring Image Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T11:22:05.498644Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.22546"},"observation_digest":"sha256:d640578b75e62ed32366856f3ef7753e5e23ea758affc0efdd698fd4585788a4","observation_id":"36072f2b-9064-4ff3-85b0-5f89be424a96","resolution":{"observed_at":"2026-06-26T11:29:24.583964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.23888","last_updated":"2026-06-22T19:34:47Z","snapshot_observed_at":"2026-08-09T10:41:41.091276Z","submitted_at":"2026-06-22T19:34:47Z","title":"E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T06:02:30.459845Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.23888"},"observation_digest":"sha256:6d21850b8f50c5dc5210a70e92958a2777989b9da1f59409d7569012b39a52b3","observation_id":"f994ea63-e58b-437c-b779-31ae20145b28","resolution":{"observed_at":"2026-07-04T12:49:52.204124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.25279","last_updated":"2026-06-24T01:31:44Z","snapshot_observed_at":"2026-08-07T06:52:40.422947Z","submitted_at":"2026-06-24T01:31:44Z","title":"MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:03.803170Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.25279"},"observation_digest":"sha256:e436b0cf622d5345089770099b523016bb32b2361c98565f0f96da2d35c2414a","observation_id":"3789f371-cba5-43a9-85ca-9b5e5f876c78","resolution":{"observed_at":"2026-07-04T20:00:08.150092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.30313","last_updated":"2026-07-01T22:00:49Z","snapshot_observed_at":"2026-07-31T20:02:13.566512Z","submitted_at":"2026-06-29T13:56:17Z","title":"TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T06:52:42.092509Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.30313"},"observation_digest":"sha256:e183f4a58bf6831be731765cfa81fa9771929b8b08213e668ea2785f124c4f74","observation_id":"06ff476a-e955-41d5-84e8-9510e2c81c41","resolution":{"observed_at":"2026-06-30T06:54:19.947742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":"arXiv (Cornell University)","work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2606.30313","last_updated":"2026-07-01T22:00:49Z","snapshot_observed_at":"2026-07-31T20:02:13.566512Z","submitted_at":"2026-06-29T13:56:17Z","title":"TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T22:29:18.856647Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2606.30313"},"observation_digest":"sha256:63b9a71308efaa36d1a2022fcccf7cdd67015fff743079d35abfc902d98bdda4","observation_id":"f22dbbf4-8137-445d-8294-8f6817a00ba9","resolution":{"observed_at":"2026-07-03T22:39:00.916214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-02T03:31:45.407270Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-15T17:27:19.686345Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:45.407270Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:0f178285bd72108748c50a2e498b6f07ec1a073424321ede30d55c896ffe9fd0","observation_id":"fa7b3241-1b38-45b5-9007-bddae5600c32","resolution":{"observed_at":"2026-08-02T03:31:45.407270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-02T01:44:20.068459Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14581","last_updated":"2026-07-16T05:21:47Z","snapshot_observed_at":"2026-08-15T02:07:28.648822Z","submitted_at":"2026-07-16T05:21:47Z","title":"Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:44:20.068459Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.14581"},"observation_digest":"sha256:230b6ed12719f3c10191d36bdcd0143e0f1c29ade755ba7f490139e25ed8c780","observation_id":"1e39b3dd-2d4e-4ff0-bd57-106651514303","resolution":{"observed_at":"2026-08-02T01:44:20.068459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-01T06:15:35.089393Z","title":"M3d: Advancing 3d medical image analysis with multi-modal llms.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22771","last_updated":"2026-07-24T04:28:33Z","snapshot_observed_at":"2026-08-14T04:51:36.183252Z","submitted_at":"2026-07-24T04:28:33Z","title":"Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:15:35.089393Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.22771"},"observation_digest":"sha256:7394306ec95cfdd3ea49e39b3babe79d0cf621d40b324a2563fd1c28c5fa7109","observation_id":"9e6e25e0-7723-432d-8ada-360944d57f86","resolution":{"observed_at":"2026-08-01T06:15:35.089393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-31T06:20:29.953458Z","title":"Meng, and Bo Zhao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-14T21:10:19.631080Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:29.953458Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:161d2b7a16c7603b8c18a5e62633c8c7bad0aa19dcaed41af452f3fdb765b1e9","observation_id":"9b759028-84a6-47a2-ba64-7c60aba90e4a","resolution":{"observed_at":"2026-07-31T06:20:29.953458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-01T00:38:25.843369Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26196","last_updated":"2026-07-28T19:00:17Z","snapshot_observed_at":"2026-08-14T08:00:57.731706Z","submitted_at":"2026-07-28T19:00:17Z","title":"Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T00:38:25.843369Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.26196"},"observation_digest":"sha256:94ff760f64c74bf121b52a5b508f92a364f56161c8278892fda40fe2925d08c5","observation_id":"c0c13d68-673d-4e3d-8620-2bbc419e8d3d","resolution":{"observed_at":"2026-08-01T00:38:25.843369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-01T13:31:49.000325Z","title":"Bai, S.; Cai, Y.; Chen, R.; Chen, K.; Chen, X.; Cheng, Z.; Deng, L.; Ding, W.; Gao, C.; Ge, C.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26554","last_updated":"2026-07-29T07:27:09Z","snapshot_observed_at":"2026-08-04T05:13:12.088260Z","submitted_at":"2026-07-29T07:27:09Z","title":"MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T13:31:49.000325Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.26554"},"observation_digest":"sha256:81388a66749a8813392e8003cd6d82d70fda44d48a090ae5d9135a128fcc4bda","observation_id":"dfb6c282-c217-4b04-887e-8be7488d40c8","resolution":{"observed_at":"2026-08-01T13:31:49.000325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-01T05:36:44.874743Z","title":"Meng, and Bo Zhao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27566","last_updated":"2026-07-30T01:19:28Z","snapshot_observed_at":"2026-08-15T14:29:56.265537Z","submitted_at":"2026-07-30T01:19:28Z","title":"Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T05:36:44.874743Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2607.27566"},"observation_digest":"sha256:cc1bdda661a90f0377c279e06e67cf958648a7118d6a773dbf034613e726c199","observation_id":"da340ddf-4a0f-4494-8801-ff5e61ec899e","resolution":{"observed_at":"2026-08-01T05:36:44.874743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T01:00:54.281987Z","title":"Bannur, S.; Hyland, S.; Liu, Q.; Perez-Garcia, F.; Ilse, M.; Castro,D.C.;Boecking,B.;Sharma,H.;Bouzid,K.;Thieme, A.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00231","last_updated":"2026-07-31T19:23:02Z","snapshot_observed_at":"2026-08-15T10:52:02.142876Z","submitted_at":"2026-07-31T19:23:02Z","title":"Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T01:00:54.281987Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2608.00231"},"observation_digest":"sha256:03371bd933c295377504e8fc6fd459c9e03fd1eefb2181a2dc4a1847357621f2","observation_id":"ddb36263-bcb2-4c54-af9f-00d976494409","resolution":{"observed_at":"2026-08-04T01:00:54.281987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-04T00:46:03.549411Z","title":"Belinkov, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00345","last_updated":"2026-07-31T23:27:39Z","snapshot_observed_at":"2026-08-14T03:28:14.313122Z","submitted_at":"2026-07-31T23:27:39Z","title":"ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T00:46:03.549411Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2608.00345"},"observation_digest":"sha256:6d3d414a60003137ead106de9aef1316cb17214e9812a33329e1b6c010892e72","observation_id":"bdc3c00f-85c1-44b6-866d-4c7cdd0290d8","resolution":{"observed_at":"2026-08-04T00:46:03.549411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T14:41:24.448336Z","title":"arXiv preprint arXiv:2404.00578 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04515","last_updated":"2026-08-05T06:49:49Z","snapshot_observed_at":"2026-08-15T14:35:54.294721Z","submitted_at":"2026-08-05T06:49:49Z","title":"CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:41:24.448336Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2608.04515"},"observation_digest":"sha256:ee25251a3b9b26b7d9da38ef1c12b12352767c2dfe6511fdbae0388f1d51343c","observation_id":"ce51c620-3de8-41b5-bf9e-30bebf1ba67a","resolution":{"observed_at":"2026-08-15T14:41:24.448336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-14T04:32:15.838226Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08713","last_updated":"2026-08-09T13:57:50Z","snapshot_observed_at":"2026-08-14T22:24:17.619964Z","submitted_at":"2026-08-09T13:57:50Z","title":"Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:15.838226Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2608.08713"},"observation_digest":"sha256:a4626a888c214b074f197d326af2f3bde98b4efbc2e991f341395cfccbb0b8b2","observation_id":"ecc433c6-e8e9-4b99-a967-8151a028bf13","resolution":{"observed_at":"2026-08-14T04:32:15.838226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T21:00:35.740016Z","title":"Meng, and Bo Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12904","last_updated":"2026-08-13T07:41:14Z","snapshot_observed_at":"2026-08-15T22:16:51.807603Z","submitted_at":"2026-08-13T07:41:14Z","title":"HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:35.740016Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2608.12904"},"observation_digest":"sha256:b0acb72cf0f0401a6e33feedf08fc98a0e9f1a5cff6a010d924e81648130a613","observation_id":"74802f81-024e-4f16-a846-98c0c0750a94","resolution":{"observed_at":"2026-08-15T21:00:35.740016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.00578/citation-record","integrity":"/paper/2404.00578/integrity","json":"/paper/2404.00578/citation-record.json","paper":"/paper/2404.00578"},"outbound":[],"paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 84 inbound Pith citation observations for arXiv:2404.00578."}