{"as_of":"2026-08-07T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcf214b703ab7ac97563d9654d36dd12ada19674012cb79c5e7e11822c869a03","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:47:08.060954Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.09634/citation-record","integrity":"/paper/2506.09634/integrity","json":"/paper/2506.09634/citation-record.json","paper":"/paper/2506.09634"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T04:47:07.620921Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.620921Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:d5834da560e6dbe4eba10bfec99d556ecfeb84f1c4bc58ff4894e4f3c3235240","observation_id":"59d1df71-1389-4d58-8a2c-ee09b32c4a33","resolution":{"observed_at":"2026-08-07T04:47:07.620921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05091","last_updated":"2025-04-25T16:36:21Z","snapshot_observed_at":"2026-08-05T13:53:02.751067Z","submitted_at":"2025-02-07T17:10:22Z","title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05091","snapshot_observed_at":"2026-08-07T04:47:07.624830Z","title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.624830Z"},"links":{"cited_paper":"/paper/2502.05091","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:8b00628560d84e89e93b00d09ec1540fbdc4330c6a27f71533ccec94ebb945bc","observation_id":"656efc58-2110-4998-a288-a64b06889b1a","resolution":{"observed_at":"2026-08-07T04:47:07.624830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-07-06T17:53:35.219482Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T04:47:07.628602Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.628602Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:4e910300bd66690fb63ae453c3d9ebb8e9f7dc13af8aa7766dc391db7a7aa757","observation_id":"7a954a7c-d5a8-4442-ba12-c67648decd15","resolution":{"observed_at":"2026-08-07T04:47:07.628602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.631850Z","title":"Shah, Andrew Johnston, Robert D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.631850Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:b39a9c9258389e1ebb897d98e541be08b940cb805cea498ff019217bcdd0a3f0","observation_id":"1c5b0f29-76a7-4997-9239-afd5e0597e8c","resolution":{"observed_at":"2026-08-07T04:47:07.631850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:14.439276Z","title":"Bruno, Eric A","venue":null,"work_id":"8e013273-c165-4f1d-a6a2-69f7f615c9c3","year":2015},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.634653Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:f65c5706307179d0aa8f990afa259d524358d98e5052929ae04b82838e31ed70","observation_id":"ddf966f4-e600-4c6d-aa4b-73395c2e83df","resolution":{"observed_at":"2026-08-07T04:47:14.534106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19330","last_updated":"2024-09-28T12:31:07Z","snapshot_observed_at":"2026-07-06T19:23:50.186410Z","submitted_at":"2024-09-28T12:31:07Z","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19330","snapshot_observed_at":"2026-08-07T04:47:07.637441Z","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.637441Z"},"links":{"cited_paper":"/paper/2409.19330","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:8e2d54174ebe709c0ce16ea8548a642b66179eac78e1fa976c18732bf39d2ef7","observation_id":"4b26adec-b0b4-4955-ab61-8013d1320908","resolution":{"observed_at":"2026-08-07T04:47:07.637441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-06T18:57:51.817317Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T04:47:07.641054Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.641054Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:5758a37d7d491ae740b338c529eb85610fd4dec59eaa556efe1b5975f80cf613","observation_id":"48dcebf1-4bf3-43a9-822f-079ce5e67f00","resolution":{"observed_at":"2026-08-07T04:47:07.641054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-07T04:47:07.644114Z","title":"Dragonfly: Multi-Resolution Zoom Supercharges Large Visual-Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.644114Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:149890d2d040da5d1bbb49a0f07af1f069ff50a2bf5c3f280d64b0fe6964f22c","observation_id":"95305907-eca2-414a-9d4f-20ead735841f","resolution":{"observed_at":"2026-08-07T04:47:07.644114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10799","last_updated":"2023-05-18T08:19:33Z","snapshot_observed_at":"2026-07-06T15:29:05.031168Z","submitted_at":"2023-05-18T08:19:33Z","title":"MedBLIP: Bootstrapping Language-Image Pre-training from 3D Medical Images and Texts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10799","snapshot_observed_at":"2026-08-07T04:47:07.647075Z","title":"MedBLIP: Bootstrapping Language-Image Pre-training from 3D Medical Images and Texts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.647075Z"},"links":{"cited_paper":"/paper/2305.10799","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:384488ff2edfc6b5efcea5b360f097b9b71208fa138d50c21375687f6b9032b4","observation_id":"a76d515b-13ab-4ff0-8da7-1aa827f86195","resolution":{"observed_at":"2026-08-07T04:47:07.647075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:14.240703Z","title":"BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval","venue":null,"work_id":"0e9e90c2-db5a-4096-bd71-7d6c2b8d9129","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.650006Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:170e09006317f2886546e6feb25d9c52fa4c0344d129670a33efaee756b39b8e","observation_id":"37b70fec-5257-4c93-851d-29b00c830b61","resolution":{"observed_at":"2026-08-07T04:47:14.321988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16386","last_updated":"2024-03-25T03:02:51Z","snapshot_observed_at":"2026-08-06T19:12:58.935604Z","submitted_at":"2024-03-25T03:02:51Z","title":"Dia-LLaMA: Towards Large Language Model-driven CT Report Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16386","snapshot_observed_at":"2026-08-07T04:47:07.652832Z","title":"Dia-LLaMA: Towards Large Language Model-driven CT Report Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.652832Z"},"links":{"cited_paper":"/paper/2403.16386","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:23d4f0b18cb9c6c271927432083d4f256f141b67e9918c1f4831b7c0ae9670fc","observation_id":"3a2baa62-f388-436a-95e3-6391794fb94d","resolution":{"observed_at":"2026-08-07T04:47:07.652832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:14.030921Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":null,"work_id":"222bb92c-102c-4b49-89e1-41637ec93877","year":2019},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.655589Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:740d699e0d5cfacd029764f8914de5abff0a0b8acb6ea6e234dbf12467f9f741","observation_id":"594844b1-255a-40dc-ad4d-807471d347b9","resolution":{"observed_at":"2026-08-07T04:47:14.100340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.860052Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":"87e712f6-9b48-4b13-803a-b6c5815cfcad","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.658248Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:2d51bd9a9efb7d4272bcc15bb653c4a7d01de4265aa409e05e52504d2b74b60b","observation_id":"124937a7-342c-49b7-8b75-0f59990804b1","resolution":{"observed_at":"2026-08-07T04:47:13.968497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.660922Z","title":"Developing Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.660922Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:8cc0f4023c6e7bd6038fd6b9bd749269a49d693f11c51a37a92b115712728893","observation_id":"2b779508-9103-42b8-a0cb-631d79a054b6","resolution":{"observed_at":"2026-08-07T04:47:07.660922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T04:47:07.663591Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.663591Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:92dfde49a4b065137ed80005dacb4477a8b756f571322b96c59306e55d7b83b5","observation_id":"4feccbb4-ac79-4e5d-ad6f-7d192f85fe18","resolution":{"observed_at":"2026-08-07T04:47:07.663591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.604001Z","title":"Ball, Norah Borus, Andrew Huang, Bhavik N","venue":null,"work_id":"87abdf21-71fb-41cd-b52b-dac50f7e8203","year":2020},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.666325Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:fab7c45d794d14feda48ede8625135b0aa62ef8e3ce4a6d52a07e0fa42c8a6fb","observation_id":"f5fff607-8b6c-4f1d-923e-6379ef9deebd","resolution":{"observed_at":"2026-08-07T04:47:13.708650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.363301Z","title":"Lungren, und Serena Yeung","venue":null,"work_id":"98a731c4-0730-462b-ae9c-d447a94cd77c","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.669216Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:12bfc43aafecccd593b94ffb3e67b5515bfe4d89af61fe4051633ba2f3f543e1","observation_id":"b356897e-0e06-49ab-90ae-43215cb14aa4","resolution":{"observed_at":"2026-08-07T04:47:13.488370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.313493Z","title":null,"venue":null,"work_id":"b3f70def-0674-4e70-853a-757883d42b50","year":2018},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.672081Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:5a17a41b554eadf04209b124da4575857d02bf5955003e8df54b15f6fdaeaaad","observation_id":"556ea59f-01cf-47ae-9322-af38c4d2464b","resolution":{"observed_at":"2026-08-07T04:47:13.321335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.032453Z","title":"MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making","venue":null,"work_id":"e55e337e-2f17-46af-bc33-59dc628f7e2c","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.675122Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:5763baa874e00d7a9243685d731becb0832291f90092d0c3a70222e476bc7854","observation_id":"79a40d5c-1666-4444-a0c4-39568d4a1496","resolution":{"observed_at":"2026-08-07T04:47:13.159421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14200","last_updated":"2024-10-18T06:31:40Z","snapshot_observed_at":"2026-07-06T19:35:48.603411Z","submitted_at":"2024-10-18T06:31:40Z","title":"E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14200","snapshot_observed_at":"2026-08-07T04:47:07.677788Z","title":"Kevin Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.677788Z"},"links":{"cited_paper":"/paper/2410.14200","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:3647574c8e3d10675ef3e5671d78000a028fe7aa400c966d2ff151df2e69d472","observation_id":"3cbc623f-fd10-44ae-abf3-1f67173aa724","resolution":{"observed_at":"2026-08-07T04:47:07.677788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.03565","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:08.488630Z","title":"Kevin Zhou","venue":null,"work_id":"13755d4c-d00b-4048-9f39-c46e3bbfbad9","year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.680780Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:f1a14c56e9c41626a54375be89223bdc0c6e5cbaeec74f98e50985da2d031f2d","observation_id":"f398a14c-3cd1-4287-a0f3-2c58b6662927","resolution":{"observed_at":"2026-08-07T04:47:08.567433Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.821806Z","title":"METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments","venue":null,"work_id":"642220ba-3497-4a78-a23b-49fe27c3f89c","year":2007},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.683384Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:14e078db441bf38810809e25d0e19558ce7fbb58379495357e65099f024eba49","observation_id":"a5794760-a898-4bd0-beee-2b7d456c3087","resolution":{"observed_at":"2026-08-07T04:47:12.937482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.695048Z","title":"Towards a holistic framework for multimodal LLM in 3D brain CT radiology report generation","venue":null,"work_id":"c33eb43f-1b3e-4579-abf7-6898d9c7f05e","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.686018Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:28dd93df6431fc0ebfc74d35d57221ed67441488c253e01f1eeebc704efda35e","observation_id":"e444ef61-6a4c-40c4-b933-5116bbda84a8","resolution":{"observed_at":"2026-08-07T04:47:12.755672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.437908Z","title":"LLaV A-Med: Training a Large Language-and- Vision Assistant for Biomedicine in One Day","venue":null,"work_id":"01639093-830a-490f-b754-ec15636a93b7","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.688760Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:085615ae4fee9ba0572b56f055d0485ed7a5686a6277b2bd7930627e8eba7f52","observation_id":"7e10a83b-decf-4894-b774-0bef881cfbcb","resolution":{"observed_at":"2026-08-07T04:47:12.584478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.236907Z","title":null,"venue":null,"work_id":"5ecedbb9-f376-457a-8b57-1cbe6904f2f8","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.691469Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:b765230cae631dd1d4b2d182c77630a8d57436cd77810166374d80d53d2bfee2","observation_id":"ff9013ea-85a7-4230-833d-a2291a85dc49","resolution":{"observed_at":"2026-08-07T04:47:12.340999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.094392Z","title":"Dynamic Graph Enhanced Contrastive Learning for Chest X-ray Report Generation","venue":null,"work_id":"788b255b-9db7-4ff0-ba22-4eed9ccc31ad","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.694107Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:9e5e2d8e588bb065fa7816781172175953d0d65f06e16af13ef726bf05a51171","observation_id":"1e1d1347-ba9f-44c9-99d4-540f68fcd32a","resolution":{"observed_at":"2026-08-07T04:47:12.149866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T04:47:07.697677Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.697677Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:36a0776f71187efcd95872270ed6fbf82e867670462b4dcc9ff50c3b057de29a","observation_id":"4adaa931-5207-495e-bbd1-7f0ca55cb3db","resolution":{"observed_at":"2026-08-07T04:47:07.697677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T04:47:07.700642Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.700642Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:6ef8495e64e44b621378bef810b0a8b325550823cf9efd323fcf9d66e9bca3e3","observation_id":"d752036f-f3da-41d7-bf24-79bda8a8573c","resolution":{"observed_at":"2026-08-07T04:47:07.700642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.931907Z","title":"Macro-and micro- anatomical, histological and computed tomography scan characterization of the nasopalatine canal","venue":null,"work_id":"94f0985d-a637-41ea-919b-7440e95d01e3","year":2009},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.703490Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:9efb985bea563bcead40ca52437b00109c598e59ec8127b6d65bcdf24c669776","observation_id":"3f76dae1-5a53-4bd6-b0d0-5d850f82c64a","resolution":{"observed_at":"2026-08-07T04:47:12.020007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.761862Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"3c1cd704-05a1-4f92-b3ce-d9f74f90c0a5","year":2004},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.706327Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:26e1dbfbc4790ef6bdd1b26b5faea8a8a106d79e4f21b15b97fd9ebd4d344034","observation_id":"910fd7f9-d15c-495d-9346-30f4a4f64400","resolution":{"observed_at":"2026-08-07T04:47:11.842518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05876","last_updated":"2024-12-08T09:45:59Z","snapshot_observed_at":"2026-07-06T20:03:25.000927Z","submitted_at":"2024-12-08T09:45:59Z","title":"MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05876","snapshot_observed_at":"2026-08-07T04:47:07.708862Z","title":"MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.708862Z"},"links":{"cited_paper":"/paper/2412.05876","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:b78b72932360960cb647f28465925f829e652969eca7f04a73eeeee24a788a14","observation_id":"40c0597a-cc1a-444e-999d-9166c23816f1","resolution":{"observed_at":"2026-08-07T04:47:07.708862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.566665Z","title":"Bleu: a Method for Auto- matic Evaluation of Machine Translation","venue":null,"work_id":"fe418698-a006-408f-88f0-ff50827c7e8d","year":2002},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.711866Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:f12cc48fc9094ce717dc2635b32b17ce3eeef0a842cbab071686b6c006fdaad4","observation_id":"2a42e4d0-3fa2-499c-a749-a9664e804bd4","resolution":{"observed_at":"2026-08-07T04:47:11.676720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.423149Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"485ede52-0559-4dcb-80a5-e0b3b980423f","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.714448Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:47ffeab9be02a51d2b4fef95c5f9ef4526da6b8ec9d04c924933a44034811196","observation_id":"d16d19a9-7886-4572-a920-c0f099914bdc","resolution":{"observed_at":"2026-08-07T04:47:11.474165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.277997Z","title":"Salvolini, E","venue":null,"work_id":"c20b75aa-f9df-462c-89f8-802c4086b57a","year":2000},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.717125Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:af1c60f343fa66fa42f1ba86b6d336da1832932696df7659e651db551375ec22","observation_id":"e89def40-1a80-42a2-b779-0d5302249e3b","resolution":{"observed_at":"2026-08-07T04:47:11.349751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.096961Z","title":"Time Is Money: Considerations for Measuring the Radiological Reading Time","venue":null,"work_id":"72163a34-78ae-43d6-b273-e98249b91642","year":2022},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.719912Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:9548e3bf4314e4dea358bb5be23dd5f97daa88f78f689164a2ba7e2a6fcfd61e","observation_id":"d7c55625-fda1-40c0-b6bb-b382ad468434","resolution":{"observed_at":"2026-08-07T04:47:11.173127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.722774Z","title":"Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.722774Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:47a8b477ed8894a1cfd417c1ab048ec2617108b8ffe923424aa3756dc2e36471","observation_id":"5b7dceb2-6ae9-4f9d-9767-12fea05b9215","resolution":{"observed_at":"2026-08-07T04:47:07.722774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.929630Z","title":null,"venue":null,"work_id":"e4ba608b-47e9-4cf8-9caa-b149447b3a72","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.725473Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:5199b80095fdd79f42bb17978fa1db7468235ae1b860a76f209d2071b9a978e3","observation_id":"7480eb91-463e-4c1b-b889-80e3340626b9","resolution":{"observed_at":"2026-08-07T04:47:11.001306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.776490Z","title":null,"venue":null,"work_id":"2e2636c1-e0b6-4037-b6f1-3a6f21306a8a","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.728638Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:9f941c98f4101dc128e012c3b19e4196925e2d069c0afa2d4197b400fcc269da","observation_id":"7e9939ad-ea6f-4414-a99a-344e21c0a209","resolution":{"observed_at":"2026-08-07T04:47:10.861999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14334","last_updated":"2023-07-26T17:52:22Z","snapshot_observed_at":"2026-08-02T04:14:16.530924Z","submitted_at":"2023-07-26T17:52:22Z","title":"Towards Generalist Biomedical AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14334","snapshot_observed_at":"2026-08-07T04:47:07.731105Z","title":"Fleet, Philip Andrew Mansfield, Sushant Prakash, Renee Wong, Sunny Virmani, Christopher Semturs, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.731105Z"},"links":{"cited_paper":"/paper/2307.14334","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:232dce76ea07edefc1e172c737e9a2fdc3d7e5ce94c982580279725011d10e1b","observation_id":"d3d44794-c411-4187-8c28-c7d1cc90b1b5","resolution":{"observed_at":"2026-08-07T04:47:07.731105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T04:47:07.733934Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.733934Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:328ef0737dd6a250c7318ee1c10a34a19cb3079c739ea0266734cb0f8dc1fd38","observation_id":"1f57a25c-8f75-4339-8799-4a0e942798c7","resolution":{"observed_at":"2026-08-07T04:47:07.733934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.527297Z","title":"Cross-modal prototype driven network for radiology report generation","venue":null,"work_id":"ca787088-df93-45e9-a2d7-6c7c21dfff45","year":2022},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.736992Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:09545dac8374961be4166a069a1ec2e51a2746fb4aa7c6f83664580b1226a057","observation_id":"fa98463d-1155-416d-867b-0f2e6da219b4","resolution":{"observed_at":"2026-08-07T04:47:10.670325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19546","last_updated":"2025-04-16T16:00:52Z","snapshot_observed_at":"2026-08-05T03:55:02.023089Z","submitted_at":"2024-07-28T17:38:21Z","title":"MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19546","snapshot_observed_at":"2026-08-07T04:47:07.741096Z","title":"XLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.741096Z"},"links":{"cited_paper":"/paper/2407.19546","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:29e7f1df85a64c5dfbd754ca00665f5e0b68f04b8468979e1dd64c675a46cb84","observation_id":"fd024453-c5ee-4cd6-b23a-8214a5f63df9","resolution":{"observed_at":"2026-08-07T04:47:07.741096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-07T10:41:28.201668Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-07T04:47:07.745722Z","title":"Towards Generalist Foundation Model for Radiology","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.745722Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:34b9746a8c48d6cacde388e7f9f29702bae43ec60165f22d4815c2083f6f9f97","observation_id":"98a3ec93-657c-4a92-bf45-7c1b99b0c292","resolution":{"observed_at":"2026-08-07T04:47:07.745722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.317967Z","title":"Zou, und Huaxiu Yao","venue":null,"work_id":"826c3fa7-26dc-434f-884d-91e683e2863b","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.752474Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:d32a193d8212d53b13a2a3195fab8e354e568f2f6f302024e811acf0986b70a5","observation_id":"883a7492-0f61-419c-868a-29c40e50901f","resolution":{"observed_at":"2026-08-07T04:47:10.399927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.756129Z","title":"Med3DVLM: An Efficient Vision- Language Model for 3D Medical Image Analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.756129Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:c3cfb7d8a5402b26e1b7332943a6530396ca447258b591e2451bac384cd0173f","observation_id":"0d50dc99-07f8-4d3a-a0b8-dbf602292b1d","resolution":{"observed_at":"2026-08-07T04:47:07.756129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.092571Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":null,"work_id":"74d4529d-c3c1-42c5-a908-11816f3ff16e","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.760736Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:8034430145ca66599109aab8ffaa997fd899827bdb15e8b6f956e5765591ee46","observation_id":"f3bc874f-1ec7-4a1a-a361-98eefc53a0bb","resolution":{"observed_at":"2026-08-07T04:47:10.209432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.895374Z","title":"Lungren, Tristan Naumann, Sheng Wang, und Hoifung Poon","venue":null,"work_id":"ba86390a-a661-4838-b3f5-6e60506191fb","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.770261Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:b83d646052afb7a56ed04d59ef3196e6de7fb4b25722114a7fb6eb7dae4edff2","observation_id":"3eb5ce39-5de0-4804-8dca-ccda4f254aa2","resolution":{"observed_at":"2026-08-07T04:47:09.979845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.708726Z","title":"Weinberger, und Yoav Artzi","venue":null,"work_id":"f7d98f5c-ccb5-4e4f-a5e4-38fcdf6c5163","year":2020},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.784587Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:2a926bc75ee9dbc74b7c15ff82050b72f315a7f2308392aa4a0a11e8068511c2","observation_id":"a8424c63-97ce-46e9-8a0a-4604076e458d","resolution":{"observed_at":"2026-08-07T04:47:09.799164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.418685Z","title":"MEPNet: Medical Entity-Balanced Prompting Network for Brain CT Report Generation","venue":null,"work_id":"a5951e2f-1b06-40b6-954e-82f294192e12","year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.805586Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:de21bb3d0888db3ad0a12054d6f666220e71c523cfc12c538eee2fc63ccdb189","observation_id":"12f782b5-3cf3-4c2f-9a47-c9d7f591e4ac","resolution":{"observed_at":"2026-08-07T04:47:09.557804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16754","last_updated":"2024-04-25T17:11:37Z","snapshot_observed_at":"2026-08-05T06:07:21.434244Z","submitted_at":"2024-04-25T17:11:37Z","title":"RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16754","snapshot_observed_at":"2026-08-07T04:47:07.828501Z","title":"RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.828501Z"},"links":{"cited_paper":"/paper/2404.16754","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:fd3fabeca903c690bf51941deb59c494a3553f6d4d3e570af22286f6f5038b93","observation_id":"3f99ebed-d651-47b5-87b0-1f2f8c00f6b6","resolution":{"observed_at":"2026-08-07T04:47:07.828501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.134461Z","title":"There are emphysematous changes in both lungs","venue":null,"work_id":"c2b62c68-7c93-4866-b398-32c14acf978a","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.941763Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:4f6015cf4b4880b6756798c7727f4f745b98dfce474d1f1dc1e1842326c6251a","observation_id":"dd49e689-3feb-418a-a7b8-e50e15fce348","resolution":{"observed_at":"2026-08-07T04:47:09.276205Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:08.902008Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"b709add0-26e1-488b-a7b2-c75a2f354a53","year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:08.060954Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:4fcfa02c19417ff835d2be4a63af3400a4946345c4ac59e65565f0bf77b90c1a","observation_id":"16f3d46d-e57f-4dec-a54b-23b8802df80d","resolution":{"observed_at":"2026-08-07T04:47:08.987645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.09634."}