{"as_of":"2026-08-04T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97f1c3537c443c5870348580f3aadbc81d13a49e7303e4ad84c19bb77d3e2042","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:43:02.337806Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.10233/citation-record","integrity":"/paper/2604.10233/integrity","json":"/paper/2604.10233/citation-record.json","paper":"/paper/2604.10233"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:0c6e48ddb9dbbb2fd489052315483928c3334fa84c88da3aae321815c6db5078","observation_id":"71e8a687-9d7f-4d8c-84ea-29cc065c1030","resolution":{"observed_at":"2026-05-11T08:20:58.331205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"af9bd385-57f6-4610-b0bc-57389386019c","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:0428f0ac91f3075d8178849752657f4d475e3575bf022c2d20f04da8adbc1fbf","observation_id":"885679bd-03eb-437a-8864-b7997f67bcc5","resolution":{"observed_at":"2026-05-17T13:59:43.005263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-07-10T13:57:06.708632Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:a59b0add7bf336050faba9615d5d4685f229f8e068ba0866bf5df53267021bbd","observation_id":"7c24f226-36f0-4a2b-94c2-22c9bdf01b17","resolution":{"observed_at":"2026-05-11T08:20:58.337878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.587224Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"3108eff5-b76f-479d-a750-a1c9991c77b8","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:e5e8dccdab4aaf24550d89e57fa6618c56ed6da2d4ce471291da2de53cdd123c","observation_id":"28cc916f-d577-456e-a3b8-9367ed76b9f6","resolution":{"observed_at":"2026-05-17T13:59:43.009653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:18dd7fd1af34dbe151525f12dc9caba6578404754af5c123eab13032fa36aee6","observation_id":"9e35857a-b8d2-4924-b5df-1874f6dda033","resolution":{"observed_at":"2026-05-11T08:20:58.346679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatio-temporal and retrieval-augmented modelling for chest x-ray report generation","venue":null,"work_id":"d6c22994-9498-417a-af50-ad13f0dfef2c","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:02583191ffd2e51de6c9317062f2f362b660a7efe3921722561778a4e16308c7","observation_id":"df48b65a-d775-4173-84f3-50775044ec35","resolution":{"observed_at":"2026-05-17T13:59:43.015945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10948","last_updated":"2025-03-16T02:23:30Z","snapshot_observed_at":"2026-08-03T12:44:11.709304Z","submitted_at":"2024-03-22T08:38:27Z","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","version":3},"cited_work":{"arxiv_id":"2405.10948","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10948","snapshot_observed_at":"2026-07-04T10:59:45.940340Z","title":"Surgical-lvlm: Learning to adapt large vision-language model for grounded visual question answering in robotic surgery","venue":null,"work_id":"b8e1740f-6776-4dc4-a787-9383312bbbb4","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2405.10948","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:0e8cbd4550d8d37508dc0f3e5b460a7438d19ba40cd90d41144180c697a62605","observation_id":"2972c0e6-4ace-42ae-aaf9-23cb34cffda4","resolution":{"observed_at":"2026-05-11T08:20:58.311872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collaboration between clinicians and vision–language models in radiology report generation","venue":null,"work_id":"af7a842d-72ea-4260-86c2-14fec55f9f30","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:33ae82f5fcf60ea3ddc353e60c6124ee85cbb3c1fd76ae0ee6a3347783ecbab9","observation_id":"2acf86df-eca7-49e2-81ed-9137992b1607","resolution":{"observed_at":"2026-05-17T13:59:43.026368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18387","last_updated":"2025-04-07T09:01:19Z","snapshot_observed_at":"2026-07-06T19:38:48.401401Z","submitted_at":"2024-10-24T02:55:41Z","title":"Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks","version":4},"cited_work":{"arxiv_id":"2410.18387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpretable bilingual multimodal large language model for diverse biomedical tasks","venue":null,"work_id":"a8e9e505-675d-4be5-acc8-1f6550444232","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2410.18387","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:645c1a9ab2b495aad26b142a6ef64875a0ef5607637729ab1d1a8fb7667b91e5","observation_id":"e442baf4-1c98-47f2-9b54-cf42217ebf8b","resolution":{"observed_at":"2026-05-11T08:20:58.318827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":"8c83ad7a-88bb-4ea1-83ba-8002663427f2","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:e99d33b98f463e7ca1b73464445a2d8e0571e52b11113295f6216e44c7a08573","observation_id":"1ab44201-8a4c-4ac6-b9d9-5401d5625989","resolution":{"observed_at":"2026-05-17T13:59:43.035546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-07-06T17:53:35.219482Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:ceef2a01bebee0e7390cfe4eac2e09789590194f2f653b717510449480b7f0e2","observation_id":"cb2eda88-b33c-444e-ba19-e771842c9bfd","resolution":{"observed_at":"2026-05-11T08:20:58.323661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data","venue":null,"work_id":"8bba023c-9593-4529-8d92-61279b4b93d0","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:cd029ba3fcf8d73cae814566c1d906c8ff774a1334fd7b3b27f20c1218d2df84","observation_id":"6689e5fc-3971-4ffb-9962-0dbed9760043","resolution":{"observed_at":"2026-05-17T13:59:43.032516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"38d75c55-ad2c-43e8-9e41-f99a0ff10015","year":2021},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:c3affe7e12ea8fc2763b793224a022a2152e362b3114c5ecca98ed4d535b1524","observation_id":"965cf1b4-ca81-431c-9e77-87e31a1d58ca","resolution":{"observed_at":"2026-05-17T13:59:43.019423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"f828bd88-4e52-468a-8bf9-73e23c92d90e","year":1991},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:09b9b166ad3bbd8c36fc5e6868f4192789f81b0429ba1966250edc26d2896a69","observation_id":"e0e0c55b-773d-436a-bd43-ff8af3433adf","resolution":{"observed_at":"2026-05-17T13:59:43.012821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T05:51:59.563169Z","title":"Learning to prompt for vision- language models","venue":null,"work_id":"d8466c6f-6439-47f7-a655-5729dc752079","year":2022},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:8814b6161ad38dbecbf9c68f203c8bd5b082e1c21d4b20bba649074a1651db24","observation_id":"71de56fe-cc81-40ff-a289-89ee9c2648a0","resolution":{"observed_at":"2026-05-17T13:59:43.023232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Con- trastive learning of medical visual representations from paired images and text","venue":null,"work_id":"e3d3dd41-975d-41ba-8104-2009664650b4","year":2022},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:14b284f02c777e3776e6ce55023c980ad1d43c14b4194388eedc63ed9d73bd18","observation_id":"3225faba-2b91-446b-98f6-6e90560e9314","resolution":{"observed_at":"2026-05-17T13:59:42.996756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Procedure-aware surgical video- language pretraining with hierarchical knowledge augmentation","venue":null,"work_id":"290c1d49-d45b-426a-a21b-edcd6f495502","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:1c2e949c207c3193146c014a40d792a046d3b358d39835d1bd34d5472ebb51bc","observation_id":"04e4dda3-4bcc-49ae-aed6-70bb521fefd2","resolution":{"observed_at":"2026-05-17T13:59:42.936017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlin: a computed tomography vision–language foundation model and dataset","venue":null,"work_id":"e86665fb-4eff-47ed-bbd5-683518372b86","year":2026},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:b8b468b92e65534a849de4c68754ccdf2e9ba81158926d8754a5b4bbf9b11b17","observation_id":"af982edf-2232-4d82-8cb3-a40740a428d1","resolution":{"observed_at":"2026-05-17T13:59:43.029332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Triad: Vision foundation model for 3d magnetic resonance imaging","venue":null,"work_id":"046461ee-6897-496f-b9b5-9f4b7e49c62e","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:3f0e205fcaf8fb4ae6ceaeaec1930169eda0d2b7bda5e06002b8a0d968a6b42c","observation_id":"33b693be-f363-4f52-9241-b30cf95c649b","resolution":{"observed_at":"2026-05-17T13:59:42.939429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning neuroimaging models from health system-scale data","venue":null,"work_id":"ca59c9e6-313e-4ea7-83da-d8a925cefc02","year":2026},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:dd4bb411221afe6ffc6e6f82ba58ccd3353d87a8ee528ee118b7ae0ff647b976","observation_id":"f1f07db4-5a90-413c-83b1-1c8fcfcc2ea1","resolution":{"observed_at":"2026-05-17T13:59:42.960277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:f207f5595426ba1bef5ba3411b5d8cb1126803427488dc0d33d6fb1fe26e104c","observation_id":"4388f767-c5fa-470f-9cb6-3ddaf465984f","resolution":{"observed_at":"2026-05-11T08:20:58.269293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:bb588ea52f6bd06cc0d6182dcca58bf564b6a42a77da620dc9ad0e9f53557ef7","observation_id":"0736d530-b06e-4bc9-a8b4-6e097667fb4f","resolution":{"observed_at":"2026-05-11T08:20:58.254258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards accurate differential diagnosis with large language models","venue":null,"work_id":"aeb60749-9678-444b-bdcb-1bc4b15bfa43","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:4acddf9739fb4ca3b84a53df30a5db42d4a6928edeba43ad49fe9291b8292049","observation_id":"ef70287c-a201-4846-9dc3-f2773fe76b92","resolution":{"observed_at":"2026-05-17T13:59:42.957568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward expert-level medical question answering with large language models","venue":null,"work_id":"fc34db42-c2bb-4b9f-80d2-ed754842b7b1","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:d09daa749c38f13d5cc47a28e3ebe6be46cbcfe41b75880a92567ed5c5ad92dc","observation_id":"2d742989-f691-40bd-91ac-9f4e4c02ba5a","resolution":{"observed_at":"2026-05-17T13:59:42.986971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medla: A logic-driven multi-agent framework for com- plex medical reasoning with large language models","venue":null,"work_id":"e0117188-e88c-4e82-a879-46235752adb6","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:ca1dea886531198290b3d133ffb7cf1753a290d4f741f1c1bf04476472afd96b","observation_id":"b5421448-b2c4-4a5a-9045-54fee4451c4d","resolution":{"observed_at":"2026-05-11T08:20:58.276274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A generalist vision–language foundation model for diverse biomedical tasks","venue":null,"work_id":"d79d4707-60c6-48bc-a9a8-77f0b431e97f","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:bd654551fa74380b484909bb2242edcf381335bb1e5a97abaa0e34204d3e9e8f","observation_id":"b72f02a3-faef-4772-bf46-a5d89c9d0f96","resolution":{"observed_at":"2026-05-17T13:59:42.978035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.20047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.383975Z","title":"arXiv preprint arXiv:2503.20047 , year=","venue":null,"work_id":"37701fc1-8a18-430d-8eb9-b5ce452f1af8","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:a51bd6cf6fcb6afe2d510dedb76e210d00217175add9ed3f2ff219d0dd2a483d","observation_id":"196b1ef7-d7a2-4d0b-801f-1cb8542f6375","resolution":{"observed_at":"2026-05-11T08:20:58.229416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic graph enhanced contrastive learning for chest x-ray report generation","venue":null,"work_id":"3ed4a6fa-efe6-4e9c-89f1-4937ddc2feab","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:fee4651bb12df8e63b4489611aa7648a01b2ef487ac5a4140f551f2812e050ee","observation_id":"7127ecd2-47d3-4ba9-bfde-76cdd8bf5981","resolution":{"observed_at":"2026-05-17T13:59:42.946463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A medical multimodal large language model for future pandemics","venue":null,"work_id":"1b26d59a-9d93-4843-bb3f-64ca34982ba5","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:86b075b55c03da47958b1cb3f782f27de6b655ab8b5199a3eabb67c42785ed28","observation_id":"27716b1b-cddf-4207-abf9-9df74fa96c31","resolution":{"observed_at":"2026-05-17T13:59:42.989419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal generative ai for medical image interpre- tation","venue":null,"work_id":"1746366f-2393-4d03-a95f-95723af0b2d8","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:f55006eb11bb2bb11c08e0fa84c1ae6921162d9b7d57127094a3f6bce84a0c42","observation_id":"f34b5b53-04c8-42d3-92d0-3e879f4bb4a7","resolution":{"observed_at":"2026-05-17T13:59:42.969361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards a holistic framework for multimodal llm in 3d brain ct radiology report generation","venue":null,"work_id":"82b52b74-c887-4c53-a069-e176d753f2fc","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:af18e3150ac85f7812f80f738899b2bbb8ec45a4b6361e92f7a0bd4f69e10744","observation_id":"73c1a773-8cfb-4ca4-9173-e7e25da55669","resolution":{"observed_at":"2026-05-17T13:59:42.992390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07042","last_updated":"2019-11-14T17:34:51Z","snapshot_observed_at":"2026-08-02T04:11:08.699777Z","submitted_at":"2019-01-21T19:01:00Z","title":"MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs","version":5},"cited_work":{"arxiv_id":"1901.07042","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.07042","snapshot_observed_at":"2026-07-09T23:26:36.938370Z","title":"MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs","venue":"cs.CV","work_id":"9f686305-3144-4f19-b5a5-0dcce109551c","year":2019},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/1901.07042","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:78aacebe9b5deb5630e08f0b305712c142afc3b6d20e580bb718142f787e01a5","observation_id":"ec1470e2-6ae5-42a4-bf14-9aeadb954c13","resolution":{"observed_at":"2026-05-17T04:16:17.195024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.16056","last_updated":"2022-04-28T01:16:11Z","snapshot_observed_at":"2026-07-06T10:10:03.255419Z","submitted_at":"2020-10-30T04:08:03Z","title":"Generating Radiology Reports via Memory-driven Transformer","version":2},"cited_work":{"arxiv_id":"2010.16056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.16056","snapshot_observed_at":"2026-07-09T23:26:36.921604Z","title":"Gener- ating Radiology Reports via Memory-driven Transformer","venue":"cs.CL","work_id":"131dccf3-b3fd-44a1-b555-fe1c16d5086e","year":2020},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2010.16056","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:8ccf8717e98dd33bb449e7f5939c0eb50cdd9cd6de478e7b46b683ac20cdb3e4","observation_id":"7f52210f-b72d-46ea-9240-3943cd91dd5c","resolution":{"observed_at":"2026-05-11T08:20:58.284897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Promptmrg: Diagnosis-driven prompts for medical report generation","venue":null,"work_id":"68a9e136-a228-4718-9d50-3942e6d126ee","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:51ae8885c4479fcc50b921348fe7d30aa48d117ed6b88ddcf42ef084088ecd8f","observation_id":"156ea7ad-b8e0-4798-94ce-fd58a2803567","resolution":{"observed_at":"2026-05-17T13:59:42.950473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gmai-mmbench: A comprehensive multimodal evaluation benchmark towards general medical ai","venue":null,"work_id":"6654a4c3-2778-433b-84fd-e0e7ab03d987","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:30abdb3c728b633ce41a408433a9986eb58e725eb305ed278384509b349eaf57","observation_id":"be8c466a-9af3-481e-85be-b5bede69c09e","resolution":{"observed_at":"2026-05-17T13:59:42.954280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnimedvqa: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":"5d191ab7-f770-4394-89a4-d02779361eda","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:317942bca3cba79c943b72344d31c4cceb5eebde4663cec1429a6f20b22b790b","observation_id":"10e844f4-7d35-4be5-93c3-562763853f2d","resolution":{"observed_at":"2026-05-17T13:59:42.983737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmt++: Adaptively collaborating llms with multi- specialized teachers for continual vqa in robotic surgical videos","venue":null,"work_id":"36bcdcc7-713d-46b7-80fa-6240f750a964","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:d6291ed330252941cc1345d0c41033d2d7b0c86ce363cee05c280ccdcd682003","observation_id":"5e236b72-212a-46ea-a51f-a2f8ccda19af","resolution":{"observed_at":"2026-05-17T13:59:42.966276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive and ex- plainable region-guided radiology report generation","venue":null,"work_id":"0ca60285-5992-491d-9ba7-d4a5b454bdb1","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:a44090907329718d34f66ca66e9f764e8ee37bb79a470fd5f9fa871c0822e166","observation_id":"275fd5fc-8d0a-4034-b588-7936e5fd2672","resolution":{"observed_at":"2026-05-17T13:59:42.980956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-07-06T21:35:36.836386Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":null,"work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:489ec90679218cc5a8a2e7a9af0d603d7939c0171ee74e005ed3aeb69351ed4a","observation_id":"96144497-895a-42ca-8828-9ccef4c52098","resolution":{"observed_at":"2026-05-11T08:20:58.221059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-11T01:07:45.051014Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:4a69df1978cf13a977e2ea337e7debe411fb6e55cf2a0727b48ef9e3518337d9","observation_id":"ac59c447-9289-4d80-beff-b11658f6d429","resolution":{"observed_at":"2026-05-11T08:20:58.261086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: En- hanced transformer with rotary position embedding","venue":null,"work_id":"084a553c-57fa-4d66-85ca-d794a9761d76","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:c8c11c4398eeeb1e43a3c81e65b9c25449384fbb2e548c558380b9e25e3e69c9","observation_id":"382e72aa-1d4f-44b2-89d4-4a856dc7b8f2","resolution":{"observed_at":"2026-05-17T13:59:42.943394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do vision transformers see like convolutional neural networks?","venue":null,"work_id":"acc9f4b6-230f-4a6b-9ab9-0cfa1753737a","year":2021},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:3a7feb2985199638a76db9494c489758b371ea8c58e7e56edb8c0794aff6a4e6","observation_id":"85709c67-c6e4-4469-9b7b-63c0de2ee9cf","resolution":{"observed_at":"2026-05-17T13:59:42.963367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14839","last_updated":"2023-06-13T06:31:46Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:43:29Z","title":"PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts","version":2},"cited_work":{"arxiv_id":"2305.14839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14839","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pace: Unified multi-modal dialogue pre-training with progressive and compositional experts","venue":null,"work_id":"fe93a40e-021b-44d4-8eba-127d416f4083","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2305.14839","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:88e235fdf3f2219e6b8e35c9a3d9da8f804170ad3f528ff5005f71956590fa27","observation_id":"d72ed521-488d-4648-892b-802c79122c74","resolution":{"observed_at":"2026-05-11T08:20:58.298006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":"cbb3a58e-d8eb-4b5e-aa6d-37e7071ef0f0","year":2021},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:494fa990482b58df5d96ee562a56ac6722269372406d6fe59a7a2c561f791ba9","observation_id":"6df0f719-58d3-4f66-977d-8a81f876bafd","resolution":{"observed_at":"2026-05-17T13:59:43.001977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12379","last_updated":"2024-07-04T02:55:57Z","snapshot_observed_at":"2026-07-06T17:05:27.005904Z","submitted_at":"2023-12-19T18:11:19Z","title":"Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning","version":5},"cited_work":{"arxiv_id":"2312.12379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12379","snapshot_observed_at":"2026-07-04T19:20:06.423412Z","title":"Mixture of cluster-conditional lora experts for vision-language instruction tuning","venue":null,"work_id":"2ee401cd-61b4-42aa-89bd-a76b0d60d215","year":2023},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2312.12379","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:a73ba83f5e8f8153428e8dea863b19b67831bcf9a1a5168b9c41422d5449c06b","observation_id":"95961ac8-9d37-4d97-8ab0-2d5c3ffe849c","resolution":{"observed_at":"2026-05-11T08:20:58.213409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10237","last_updated":"2024-09-01T16:39:31Z","snapshot_observed_at":"2026-07-06T18:00:44.208590Z","submitted_at":"2024-04-16T02:35:17Z","title":"Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2404.10237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10237","snapshot_observed_at":"2026-06-30T15:34:48.332917Z","title":"Med-moe: Mixture of domain-specific experts for lightweight medical vision-language models","venue":null,"work_id":"63c5c63f-4f3d-4a46-9bcc-300265d96873","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2404.10237","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:e1e600f34194e6584bc1539d08782fa81741a69c2ff5a9a273adbdfebbf9bb69","observation_id":"90e1b575-01a0-404d-8864-38a4b2c59217","resolution":{"observed_at":"2026-05-11T08:20:58.235552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2401.15947","doi":"10.48550/arxiv:2401.15947","metadata_source":"pith","pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","venue":"cs.CV","work_id":"63cb47e5-f562-42d1-8877-63216e4c0af6","year":2024},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:3a1d730a23622179d2f75a92bb8a432f79f5420f99b6e1ac3df040bcd38acfef","observation_id":"aefe669f-46d9-440c-8157-bff5acc24a51","resolution":{"observed_at":"2026-05-16T02:33:30.459169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"fc7c9a0c-bc94-4f61-8ec5-df0aa24263fb","year":2022},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:9b39600f22c6268751816124d34abbf63f2654f552d82d57274a596e02a4bd24","observation_id":"e759b238-5fae-4070-848e-dcc4c4d264a7","resolution":{"observed_at":"2026-05-17T13:59:42.971861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"562f2e18-770e-4901-8d17-d1b5a0feaf49","year":2020},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:0b07c99a9268243782eec69d32c7596436b5ba8ec06c8be0649c479d1795abbb","observation_id":"18967fb0-cb06-4163-8415-1433c13aa1b3","resolution":{"observed_at":"2026-05-17T13:59:42.974919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":17,"verified_fuzzy":31},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2604.10233."}