{"as_of":"2026-08-04T19:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c317144bc90ee904cb67840955a8ca4e2f3f8cafac7d2be40f5d7f1a2b361b4","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:33:58.234123Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16327/citation-record","integrity":"/paper/2607.16327/integrity","json":"/paper/2607.16327/citation-record.json","paper":"/paper/2607.16327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:53.916022Z","title":"Deep learning tech- niques for medical image segmentation: Achievements and challenges,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:53.916022Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:3ceb2cbaa363e2abf5d3c7676ab8a3b830ace0978725a6f47f8bd95ab283165b","observation_id":"ccb9c877-32eb-4828-97ef-69ea95b821d8","resolution":{"observed_at":"2026-08-02T03:33:53.916022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:53.981044Z","title":"Deep learning for medical image-based cancer diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:53.981044Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:f852d9e799afece558923fa04621848171c3822f556e163e6287533a732445f5","observation_id":"9f4b51bf-a75b-4164-a5a3-69ad9722a9a1","resolution":{"observed_at":"2026-08-02T03:33:53.981044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.047140Z","title":"U-Net: Convolutional net- works for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.047140Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:79be71a415402ad79141e045dac0f882ad972c7ff3c678899e9d77dd6e5ba3bd","observation_id":"ef35072a-6485-45b3-9e25-9aac722185a2","resolution":{"observed_at":"2026-08-02T03:33:54.047140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.112810Z","title":"UNet++: A nested U-Net architecture for medical image segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.112810Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ba9c5aa4e77a7bd3502b83d934f3850009b360310182a7a54b271fbdab6cae78","observation_id":"f3edaa6e-c1ac-43bb-bcdf-6e398ee43691","resolution":{"observed_at":"2026-08-02T03:33:54.112810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03999","last_updated":"2018-05-20T23:33:30Z","snapshot_observed_at":"2026-07-06T06:32:53.966022Z","submitted_at":"2018-04-11T14:13:03Z","title":"Attention U-Net: Learning Where to Look for the Pancreas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03999","snapshot_observed_at":"2026-08-02T03:33:54.180627Z","title":"Attention U-Net: Learning where to look for the pancreas,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.180627Z"},"links":{"cited_paper":"/paper/1804.03999","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:8adeacecff315ca1905bc1ddcf2ee30d04c11d38d185a04b6aa9e0359f994bb7","observation_id":"aa6ed495-a631-4050-8767-5aba943efc68","resolution":{"observed_at":"2026-08-02T03:33:54.180627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.242270Z","title":"Swin-Unet: Unet-like pure transformer for medical image segmenta- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.242270Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:e2ff397a765a6ff832ec347b65f1a7a724929d5703d1860fc0a6432e758b782e","observation_id":"8d064f21-0605-41a8-892d-57e17ba701ac","resolution":{"observed_at":"2026-08-02T03:33:54.242270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.365978Z","title":"nnU-Net: A self-configuring method for deep learning-based biomedical image segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.365978Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:df1edda58252982034cd0b569aef2641d4fbeca2e07c0947f874dbf8e8af3dba","observation_id":"15439499-5e3e-45ba-a7c1-b4277f5f0b7c","resolution":{"observed_at":"2026-08-02T03:33:54.365978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.439157Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.439157Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:1979e2b292a0fc81b389148cd395dc7ae9c706190c46bfe5efba70670a4e8ec1","observation_id":"38ec1d6d-3275-4a6a-a9a1-56e768c4a92e","resolution":{"observed_at":"2026-08-02T03:33:54.439157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.512035Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.512035Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:5a30548a42a6a0a9b0c969fa5d2000a2d2cab812bbc6fee151ff59828e2069a7","observation_id":"02f9707a-dcae-4e74-8e70-1ef9c75b5b51","resolution":{"observed_at":"2026-08-02T03:33:54.512035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.580133Z","title":"GLoRIA: A multimodal global-local representation learning framework for label- efficient medical image recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.580133Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:5a79d92c34e3290d5ffbf29fa03f670bafbcb39b6c809eb89cdef8c8bb94eac2","observation_id":"dbf4b19c-e152-4b54-ace1-91f4af370e69","resolution":{"observed_at":"2026-08-02T03:33:54.580133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.806210Z","title":"LViT: Language meets vision transformer in medical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.806210Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c6bf2faa6a580bb4b7d4f3ab81a058d14d7e302f86ba7b41b7e8a14668863bf1","observation_id":"b2662fa3-f2d8-479b-8e2e-dbc88add48ef","resolution":{"observed_at":"2026-08-02T03:33:54.806210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.906368Z","title":"Ariadne’s thread: Using text prompts to improve segmentation of infected areas from chest x-ray images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.906368Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:0125c247f76046d4b86ef1c6832e4bf6a814ab1a747d15b33d4237da78408f37","observation_id":"4aec5cc1-f463-4c5e-8968-105fcb33c02c","resolution":{"observed_at":"2026-08-02T03:33:54.906368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.985092Z","title":"Text-guided cross-position attention for segmentation: Case of medical image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.985092Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a63343da9b0242f18600b3b232eef229d0da03413bd38f607a7a689328825561","observation_id":"db80b1ee-d729-4e65-818d-9986ad89c2f4","resolution":{"observed_at":"2026-08-02T03:33:54.985092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.105671Z","title":"Harnessing text insights with visual alignment for medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.105671Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c22ef9943dcd5bfb78acec8307c7c9f1e8c3a87a6dbed8d8896665bccd0d5216","observation_id":"f49e95bd-2331-41b7-993d-9a4c6ec1c1a0","resolution":{"observed_at":"2026-08-02T03:33:55.105671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.187965Z","title":"ViTexNet: Vision-text guided dynamic convolution network for medical image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.187965Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:8168872f907ddaeeee200b4307b3e3c013b94ffacb73577f41eb2cfdf0021b42","observation_id":"56682ac8-3629-4413-a5e8-038801929993","resolution":{"observed_at":"2026-08-02T03:33:55.187965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.284254Z","title":"Progressive cross-scale semantic alignment for language-guided medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.284254Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ca1f48a0c9c1ee81ce2c63a80b7fe17879813858fc80fcb9f391143bf8a583ab","observation_id":"33998b4c-a87f-493b-a2b3-de790d01266b","resolution":{"observed_at":"2026-08-02T03:33:55.284254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.353745Z","title":"Making the most of text semantics to improve biomedical vision–language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.353745Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:38cef00c1a73968559d50c0fb87d5f938d1d42e362df317e91f7aec224d42daa","observation_id":"617ab67b-7a07-456c-a34b-625a956520de","resolution":{"observed_at":"2026-08-02T03:33:55.353745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.420105Z","title":"Multimodal spatial attention module for targeting multimodal PET–CT lung tumor segmen- tation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.420105Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ac9a6dd1a0281ac1a9ae7e2b141c748ae993eb55fe8ff8801a9a7bc03e34ea0a","observation_id":"e9c3c2af-d64f-45fe-a7d6-9727eb0a0270","resolution":{"observed_at":"2026-08-02T03:33:55.420105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.502601Z","title":"Task-driven image fusion with learnable fusion loss,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.502601Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:0af54d4ad159058891cf0b4a9e422f1dec0cea5e0dcdbf5caffd34006df92158","observation_id":"aa00e67b-989b-4334-a743-c7adfe12a258","resolution":{"observed_at":"2026-08-02T03:33:55.502601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.598863Z","title":"OSegNet: Operational segmentation network for COVID-19 detection using chest X-ray images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.598863Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:26c8ff557230c36381ee4f3da6156955b046ab86514aeb562e25f08f2436e167","observation_id":"a92034d7-f3ca-4536-bb94-63298b780d41","resolution":{"observed_at":"2026-08-02T03:33:55.598863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.836541Z","title":"Kvasir-SEG: A segmented polyp dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.836541Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ae2a83a48ca40d1e3b46d90e16d6d041a5e19ab8446e2f4a661c526c2ff45076","observation_id":"1a75f160-6048-47cb-99be-851aadb7109d","resolution":{"observed_at":"2026-08-02T03:33:55.836541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.919093Z","title":"MAdapter: A better interaction between image and language for medical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.919093Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:628c9b7062afdb008576c5a3af931c053c2ab578d65f26fc72d7ff7f96ef16c3","observation_id":"6714cf34-f41e-4804-81af-825014a6ad85","resolution":{"observed_at":"2026-08-02T03:33:55.919093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.014165Z","title":"Frequency- domain multi-modal fusion for language-guided medical image seg- mentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.014165Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ed49ca3912800595b40eb63381a59874f4069056f6e850e936a9ff29cee42125","observation_id":"82f41ed1-91fb-4d90-8e37-79dafaade6a2","resolution":{"observed_at":"2026-08-02T03:33:56.014165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.073115Z","title":"EviVLM: When evidential learning meets vision–language model for medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.073115Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:f4c055b6734c03beffbd1c587582914bcd9dd4a2f9a5104a6a6e6c3712e1a7a9","observation_id":"53bf893a-44b0-42fb-87d6-a66358e35aa8","resolution":{"observed_at":"2026-08-02T03:33:56.073115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.155760Z","title":"Cross- modal conditioned reconstruction for language-guided medical image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.155760Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:9419494b7bb57232edbfa7f50f97f1d84ca97f5b4670ad6fdbb1efc8bcc95434","observation_id":"5fe58786-1db7-40fb-9af0-b03b4914a82f","resolution":{"observed_at":"2026-08-02T03:33:56.155760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.247291Z","title":"SGSeg: Enabling text- free inference in language-guided segmentation of chest X-rays via self-guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.247291Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:5405a6dee9f42445392c8e0b5cc72cce281ef69e042aa80932724979f970b4db","observation_id":"3d63d240-409d-4c02-8355-3a0b1ddfb798","resolution":{"observed_at":"2026-08-02T03:33:56.247291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11055","last_updated":"2025-07-19T01:01:24Z","snapshot_observed_at":"2026-08-03T22:47:25.282814Z","submitted_at":"2025-07-15T07:38:49Z","title":"Alleviating Textual Reliance in Medical Language-guided Segmentation via Prototype-driven Semantic Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11055","snapshot_observed_at":"2026-08-02T03:33:56.305981Z","title":"Alleviating textual reliance in medical language-guided segmentation via prototype-driven semantic approximation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.305981Z"},"links":{"cited_paper":"/paper/2507.11055","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:e934bc7885731eddaef628596dbf7cbe1f5493cc0e2c4f83fe3e7bed864f3d69","observation_id":"7f1cce9d-9ea4-4e7e-a777-8206e2317d64","resolution":{"observed_at":"2026-08-02T03:33:56.305981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.402128Z","title":"Cross-aware early fusion with stage- divided vision and language transformer encoders for referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.402128Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:5b083882192d7ebb9326e1fd0f3d8a7f83b34198d3790c5c45e33916e508e497","observation_id":"184c3eab-c1d6-4fa2-ab81-0c48e4f16be0","resolution":{"observed_at":"2026-08-02T03:33:56.402128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.494122Z","title":"CM- MaskSD: Cross-modality masked self-distillation for referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.494122Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:edbe6c05a666adc8a52cd6cb53f99d0e7562cd4539d7117b7a3f70a2ec10b211","observation_id":"87ec8db7-05e9-4acc-8e9c-c32f1eee7932","resolution":{"observed_at":"2026-08-02T03:33:56.494122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.625962Z","title":"Bring adaptive binding prototypes to generalized referring expression segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.625962Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:83f020e945cd298a96180530e5e2e7c83adb982e3432619b74469930594de49a","observation_id":"cf30cb17-a266-4f2b-abeb-20b4128f61f7","resolution":{"observed_at":"2026-08-02T03:33:56.625962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.717708Z","title":"Deep learning-based clas- sification of healthy aging controls, mild cognitive impairment and alzheimer’s disease using fusion of MRI–PET imaging,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.717708Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:3a6a1a8d9d5a1ec065cf36e76bc1d25475ca54abafb43e99dfe59810c83483e8","observation_id":"907aec0a-aa79-4011-8747-6a3d8d68b716","resolution":{"observed_at":"2026-08-02T03:33:56.717708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.809615Z","title":"A survey on ensemble learning under the era of deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.809615Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:811c6feebbf103184a4f4ab08ea68c8dfc93070ecf6dbd69e4a53061ea56f02c","observation_id":"24efab2f-d1f3-4f05-8e0e-768675f6c12b","resolution":{"observed_at":"2026-08-02T03:33:56.809615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.898966Z","title":"Advancing multi-modal beam prediction with cross-modal feature enhancement and dynamic 14 fusion mechanism,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.898966Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:925e64fc330c768b6e6b0a58545fd11a1112abd4c8747d9714615c6b8ff2d3d3","observation_id":"1dc01c36-eb4d-433a-8928-dd2b7b2fd2e5","resolution":{"observed_at":"2026-08-02T03:33:56.898966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.988194Z","title":"AMFuse: Add-multiply-based cross-modal fusion network for multi-spectral semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.988194Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:9cc147da76e20027d7b915c981544a93abcd1a643eb18d07581f64153c822c8e","observation_id":"5815535d-b1bf-4b44-8748-362f777a837e","resolution":{"observed_at":"2026-08-02T03:33:56.988194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.069789Z","title":"ICAFusion: Iterative cross-attention guided feature fusion for multispectral object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.069789Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:79b90d2e8f4454654bf6f231e32cfcb06b934c6f524cc5842c1b03a4d82557c9","observation_id":"cb9b1452-7c5c-4e1b-858c-5715be6c76f8","resolution":{"observed_at":"2026-08-02T03:33:57.069789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.191190Z","title":"Pre-gating and contextual attention gate: A new fusion method for multi-modal data tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.191190Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:8866fec683c4e4fc465cc07d4bcde225620021acaf4490ec4b8d396b66d8781e","observation_id":"bf6c28a9-0c4b-4105-9f89-ab4300f95cc8","resolution":{"observed_at":"2026-08-02T03:33:57.191190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.275790Z","title":"MsgFusion: Medical semantic guided two-branch network for multi- modal brain image fusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.275790Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c019519d7967ab9f984727c12cc60fc11851037d7084172e0d8b48347cde5223","observation_id":"603f0933-8a78-4ddb-9fda-daf18a43b8e6","resolution":{"observed_at":"2026-08-02T03:33:57.275790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23365","last_updated":"2025-05-29T11:42:57Z","snapshot_observed_at":"2026-07-06T21:32:52.588223Z","submitted_at":"2025-05-29T11:42:57Z","title":"MCFNet: A Multimodal Collaborative Fusion Network for Fine-Grained Semantic Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23365","snapshot_observed_at":"2026-08-02T03:33:57.334363Z","title":"MCFNet: A multimodal collaborative fusion network for fine-grained semantic classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.334363Z"},"links":{"cited_paper":"/paper/2505.23365","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:09a1294573bf0a37868a0b5a33fdd851fc67874f0da6777ded4a5ad24608320d","observation_id":"523a052e-91f2-4382-b937-9961366a4c32","resolution":{"observed_at":"2026-08-02T03:33:57.334363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.449823Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.449823Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a33a5225a62be94933002195754c685793aac9fd286b1504eb50bb1189102cbb","observation_id":"0f425487-771b-4854-94b2-1fcb5aebe8a4","resolution":{"observed_at":"2026-08-02T03:33:57.449823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.511092Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.511092Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:e12cc111916499a3f6cc73246e50b3f815371f91dd1e0038ccb0e1310de4e379","observation_id":"8fff4c05-fe55-425d-a6e2-08f0cb74e0c3","resolution":{"observed_at":"2026-08-02T03:33:57.511092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.746800Z","title":"MAXIM: Multi-axis MLP for image processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.746800Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:1333d7b7163d72ab85b0c4ed85e9e8c8f87d4bdf9ae41386e5cab95d6be13fd5","observation_id":"f3347968-74d5-4695-8a92-421669849ac3","resolution":{"observed_at":"2026-08-02T03:33:57.746800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.852059Z","title":"Domain-specific language model pretraining for biomedical natural language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.852059Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:d6e4a3ca9d7468ba066499bd216ab6048e0a136af04037daa5439d813ff4f80a","observation_id":"697b5d7a-49a1-45f5-b571-8aadd539ebcb","resolution":{"observed_at":"2026-08-02T03:33:57.852059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16707","last_updated":"2026-06-22T18:16:59Z","snapshot_observed_at":"2026-07-06T16:53:43.840652Z","submitted_at":"2023-11-28T11:32:23Z","title":"Full-resolution MLPs Empower Medical Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16707","snapshot_observed_at":"2026-08-02T03:33:57.687295Z","title":"Available: https://arxiv.org/abs/2311.16707","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.687295Z"},"links":{"cited_paper":"/paper/2311.16707","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:7e1c3b488667f38cf465760f8419c2d0b272f5b50ee0d1a7c56ed0b19b77e462","observation_id":"8033f2c1-9253-42a0-be9a-26c6e8d8cd9b","resolution":{"observed_at":"2026-08-02T03:33:57.687295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:58.027923Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.027923Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:9ab0bab7108a29eff0f1ad488435e8d3b0f27055b939db61fbff9b90d0bfaf8e","observation_id":"23feed39-6b28-4a5c-86cf-782f467a7724","resolution":{"observed_at":"2026-08-02T03:33:58.027923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07706","last_updated":"2024-06-20T09:14:54Z","snapshot_observed_at":"2026-07-06T16:06:22.526631Z","submitted_at":"2023-08-15T11:28:21Z","title":"Exploring Transfer Learning in Medical Image Segmentation using Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07706","snapshot_observed_at":"2026-08-02T03:33:58.108632Z","title":"Exploring transfer learning in medical image segmentation using vision–language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.108632Z"},"links":{"cited_paper":"/paper/2308.07706","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:1dbb265f3455917dd0c1dbcfbf770244b37aeb7691a884a4b33786064aa23a6f","observation_id":"f70ff458-afdc-4d65-9121-9f4983c604c3","resolution":{"observed_at":"2026-08-02T03:33:58.108632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.926438Z","title":"V-Net: Fully convolutional neural networks for volumetric medical image segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.926438Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ffd5cb6495cda8df06c836c7ce792e7be020afdfe5a47464b36192f5f7427ede","observation_id":"69ef79aa-7110-4cb2-8a15-2e0736a3ea21","resolution":{"observed_at":"2026-08-02T03:33:57.926438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:58.185821Z","title":"Segment anything in medical images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.185821Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:32f060e2460741071b3039a210100e3fceca2a7171cd15cdc33254a3f356b324","observation_id":"c63de55a-87be-4207-830c-84485f4de916","resolution":{"observed_at":"2026-08-02T03:33:58.185821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06465","last_updated":"2020-05-13T13:04:37Z","snapshot_observed_at":"2026-08-04T06:53:47.606776Z","submitted_at":"2020-05-13T13:04:37Z","title":"MosMedData: Chest CT Scans With COVID-19 Related Findings Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.06465","snapshot_observed_at":"2026-08-02T03:33:55.775010Z","title":"Available: https://arxiv.org/abs/2005.06465","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.775010Z"},"links":{"cited_paper":"/paper/2005.06465","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:55676b86a0fc97530c8672c6558c81d2b5f8f6c4a7cd0ec6b4efc8c2d61658fb","observation_id":"2dec7d51-e1b5-41e9-8e07-6d2665f21209","resolution":{"observed_at":"2026-08-02T03:33:55.775010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:58.234123Z","title":"degree and is a jointly trained Ph.D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.234123Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:f8d756a0eefb554423d4dae025fb468db9dead6c3120b5506d9f170b37286917","observation_id":"40b3cb24-6c6a-4d6c-ab2a-37cc6cee5990","resolution":{"observed_at":"2026-08-02T03:33:58.234123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-02T03:33:54.719761Z","title":"Available: https://arxiv.org/abs/2303.00915","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.719761Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:7c86df63aa115326ae749c993f74aa2dd4bb488c89e4f0a18a470c8230bf2699","observation_id":"59f09a0d-0f69-4929-aae7-d780548d24aa","resolution":{"observed_at":"2026-08-02T03:33:54.719761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T12:44:01.263308Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.16327."}