{"as_of":"2026-08-08T12:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:433ec431dfc3eff852a826855a43563182812afd500cd3ea0baa1bccd2abffc2","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:24.486647Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15123/citation-record","integrity":"/paper/2505.15123/integrity","json":"/paper/2505.15123/citation-record.json","paper":"/paper/2505.15123"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:21.515099Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.515099Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:a0863780cc13190c3971fa75fde65961014dc962896e551908084e9a7b4ca110","observation_id":"2f20f9cd-1521-4405-a2af-73f8028cceec","resolution":{"observed_at":"2026-08-07T15:27:21.515099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.910772Z","title":"Detector-free weakly supervised grounding by separation","venue":null,"work_id":"262310ad-66ad-432e-b038-405e44d67d73","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.547480Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c2e33d5fc4865b501f182075bd88149989979ced8f90f29eb7ad1a03315f7205","observation_id":"9f9893fc-7d8e-44f3-9f3e-2cded8986c0f","resolution":{"observed_at":"2026-08-07T15:27:25.915628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-07-06T12:55:27.843060Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-07T15:27:21.565626Z","title":"Exploring visual prompts for adapting large- scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.565626Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:b5112069085d278b82e9f56fb70d90df0251afb0f1a867fbd3ac0cc7f98a2a69","observation_id":"a3177020-49a8-40e6-b885-eefd51385243","resolution":{"observed_at":"2026-08-07T15:27:21.565626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.895517Z","title":"Learning to exploit temporal structure for biomedical vision-language processing","venue":null,"work_id":"88f54bfd-9709-445d-8d94-ff18cb785257","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.653820Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:0e7b224cbd621089e7996787f98a93a6bd2b0c4fec53decd55acca77501723ef","observation_id":"3416f9d8-ea41-4b30-bd3a-1a222f9a465d","resolution":{"observed_at":"2026-08-07T15:27:25.900500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.879502Z","title":"Im- proving pneumonia localization via cross-attention on med- ical images and reports","venue":null,"work_id":"f267abe3-1996-4154-b548-7ac082877b69","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.723948Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:689b9d3089ff8f2888c72a349a91b3a5ef6f6df6fb3960aa0aeb3343d09ec5fb","observation_id":"c236f2ef-358c-4fb9-a556-e8b35af29b94","resolution":{"observed_at":"2026-08-07T15:27:25.884236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.864722Z","title":"Making the most of text semantics to improve biomedical vision–language processing","venue":null,"work_id":"f1fdd0cb-8043-4854-9175-0c074c0117c3","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.769655Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:dc78f3a60b33efee6e500b74230ed018fccea89b2c79078ecd253c0e4e33a31b","observation_id":"896d6bdb-9f38-4c4e-947e-026a1bab3bbe","resolution":{"observed_at":"2026-08-07T15:27:25.869433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.849605Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"d0aba9cb-dcf9-4d8b-b5b0-e5d48cddd97b","year":2018},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.834741Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:cf53decbc3b2a39dd7fbc4aca9828933c27400365406e55e1c9b8c5df8de00ff","observation_id":"20524315-86fb-4bdf-a880-ea4c9fce9d90","resolution":{"observed_at":"2026-08-07T15:27:25.854728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:21.954245Z","title":"Generic attention- model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.954245Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7db5aec4f1b36a23a015542b328fc074cf60f09d4f64a5ee085b715a6de229a0","observation_id":"a9391a63-6744-417f-877a-50b342985715","resolution":{"observed_at":"2026-08-07T15:27:21.954245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.808293Z","title":"Knowledge aided consistency for weakly supervised phrase grounding","venue":null,"work_id":"edfcca3f-c1a1-4fee-9708-2975c489f12c","year":2018},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.061692Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:905539791b05fb76a423ad62a194b8c4f014bbbcc23b8f5e750c8d509bdabf0c","observation_id":"67be6692-4e7d-4415-aa9a-e7e907ac3d6e","resolution":{"observed_at":"2026-08-07T15:27:25.813056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.791556Z","title":"Querymatch: A query-based contrastive learning framework for weakly supervised visual grounding","venue":null,"work_id":"08f33c78-59b6-41ab-a879-07f522eff32a","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.134897Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7ccb1eaa068ccfc56f5e6970852a3a3bf194ace1100b89820ee0dc4eeceda4ac","observation_id":"cf0cadaa-ffae-4f77-86d8-52b0f6977666","resolution":{"observed_at":"2026-08-07T15:27:25.797627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.776101Z","title":"Medical phrase ground- ing with region-phrase context contrastive alignment","venue":null,"work_id":"680e89a1-b290-47b9-8562-46d6785afc32","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.179752Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:5c7c17ee187307311f6aee48d80925f337c82bd853a14f00b44ae71fa6b376e9","observation_id":"0022b111-94ac-479c-80fe-4f59b0997180","resolution":{"observed_at":"2026-08-07T15:27:25.780726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-07T08:31:58.372526Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-08-07T15:27:22.224494Z","title":"Chexagent: Towards a foun- dation model for chest x-ray interpretation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.224494Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:41cfad1d1860e107589e0f740ff3d157229121cf220f3be621a25793b8763027","observation_id":"39d4635b-8722-4f76-981a-b727d611bb67","resolution":{"observed_at":"2026-08-07T15:27:22.224494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.758699Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":"c6b8259e-26e3-4b96-8375-33a33564936a","year":2020},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.339633Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:a5d878d776ce3d8a6c37fe675b7de416d7e5737b8f37ec65e1ee443e97ec6b48","observation_id":"2312244e-b175-47bc-8e74-12cf4fa9345f","resolution":{"observed_at":"2026-08-07T15:27:25.765128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.741590Z","title":"Align2ground: Weakly supervised phrase grounding guided by image-caption align- ment","venue":null,"work_id":"655dfba5-dcec-40cc-85c2-0aab871d72a4","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.384732Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:84149924b57a3c7d3db6e46eb6008721fef221f679882c95ab4a91833ba1db46","observation_id":"cb559d53-c7c2-427c-8cdc-d6f59c7f165d","resolution":{"observed_at":"2026-08-07T15:27:25.746808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.725067Z","title":"Transvg: End-to-end visual ground- ing with transformers","venue":null,"work_id":"2bedf1de-b088-4e9b-8d04-1ceda574d683","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.439252Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:12c7982e952f663fec1737fbf2b075160792d95dc57eff3312f7d733f0df8b9c","observation_id":"43ce920c-12b3-4ed1-86f1-a7317df769a8","resolution":{"observed_at":"2026-08-07T15:27:25.730680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.707375Z","title":"Chest imaging representing a covid-19 positive rural us population","venue":null,"work_id":"8f73e67a-9afb-426e-a6a5-a95bdc7d9484","year":2020},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.513134Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:43a8b8a5f362a2b6ecf400ef19611dc706c0ce0b8ba6943fe4dc9676b390d7e8","observation_id":"f2e9fb2b-ccd5-43ce-90b7-99026d01a512","resolution":{"observed_at":"2026-08-07T15:27:25.714343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.691371Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"cd08c680-b862-4169-8545-2052c673c0bc","year":2014},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.722272Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:d6d856bd248726c9739c99673329da5b2258b1a67727979013f085c0a159568b","observation_id":"1220e49c-91e6-4eae-b985-f70d1c54eac0","resolution":{"observed_at":"2026-08-07T15:27:25.697048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.674288Z","title":"Neural se- quential phrase grounding (seqground)","venue":null,"work_id":"f11f5da9-26d0-421c-bb65-5adf5211ecc7","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.815176Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:670356483e94d7fec2730ed94dea9dcfae537cd58166dc40710498a8dccdf375","observation_id":"4b767571-d09a-4669-820b-d489674e4fe7","resolution":{"observed_at":"2026-08-07T15:27:25.679253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:22.845556Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.845556Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:36320034dbf96a44604df5e7c8290a15fba8a414823f89284fa23408914c8e97","observation_id":"2230342b-71bb-4e1e-8472-f8f15393bbcd","resolution":{"observed_at":"2026-08-07T15:27:22.845556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.648317Z","title":"Medrax: Medical reasoning agent for chest x-ray, 2025","venue":null,"work_id":"c519f684-9630-4b06-90a8-03bbd7131904","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.886020Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:6bc3287db0575c5d70b5cd04f647ba6c4c547487cbff3061dc2c3ce1a35ab0a3","observation_id":"3902d161-2c3e-491c-a87c-07f614dedb20","resolution":{"observed_at":"2026-08-07T15:27:25.653125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.630760Z","title":"Contrastive learning for weakly supervised phrase grounding","venue":null,"work_id":"19236a77-44a3-4561-9c41-570c232e37a7","year":2020},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.016809Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:5a53593b5f42701873c52ae83a274db3d16e2e5fcd608330cb47df45a5f193d7","observation_id":"e3120ba6-c6ee-42fd-9349-b05c84416fa3","resolution":{"observed_at":"2026-08-07T15:27:25.636925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23822","last_updated":"2024-10-31T11:07:26Z","snapshot_observed_at":"2026-07-06T19:42:47.238254Z","submitted_at":"2024-10-31T11:07:26Z","title":"Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding","version":1},"cited_work":{"arxiv_id":"2410.23822","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23822","snapshot_observed_at":"2026-08-07T15:27:24.809687Z","title":"Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding","venue":"cs.CV","work_id":"c9745967-f036-4f03-a210-68013516a230","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.081062Z"},"links":{"cited_paper":"/paper/2410.23822","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:0015db6743918d9e395e7d39aa0aca2ff00177b87079e80a4e302fc76e749117","observation_id":"5a02727f-df45-4f4e-bc18-5e82890a4c5b","resolution":{"observed_at":"2026-08-07T15:27:24.815273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.611132Z","title":"Improved visual ground- ing through self-consistent explanations","venue":null,"work_id":"e1dc0ebb-d8c8-45e9-87ec-24406f11e1bd","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.136167Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:59e322cb8e0065cf476d4e46080fa560ae49cba7b3ac00ed0b90081c1a7e6a0f","observation_id":"98aee0a4-cc98-4fc0-87cb-58380dad96a0","resolution":{"observed_at":"2026-08-07T15:27:25.617105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.593035Z","title":"Multi-grained attention with object-level ground- ing for visual question answering","venue":null,"work_id":"aa28c6aa-d5f5-4f6f-bfcc-c9e39ad26058","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.232298Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:b6e867a7b1f4431799f66f30b206b500e4aff157d3305f52979c5e708438785c","observation_id":"b2036a8b-ffe5-4ecd-bfe5-e59c2835945e","resolution":{"observed_at":"2026-08-07T15:27:25.599321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.575558Z","title":"Verjans, Minh-Son To, and Vu Minh Hieu Phan","venue":null,"work_id":"96649fc8-d8c7-4df4-a7d4-5ae2dd0970b9","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.342306Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:4d2ce13ebf95ebb69f2f83d1451af894f080c91bfbedf3e2b8b85d51beaf3978","observation_id":"8fca1f9d-fbd2-4caa-86bc-47279c2a3e70","resolution":{"observed_at":"2026-08-07T15:27:25.580866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.558621Z","title":"Visual grounding of whole radiology reports for 3d ct images","venue":null,"work_id":"02c8a062-d895-49f0-b43e-6e6b5a7af7a0","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.388900Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:ec6477966c14c4415b3ab89ae698b717879a2fc065cb03e207f3ef5863d29b8a","observation_id":"c89228c2-15da-4118-9076-6c2952c754a6","resolution":{"observed_at":"2026-08-07T15:27:25.563906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.542171Z","title":"Rad- graph: Extracting clinical entities and relations from radiol- ogy reports","venue":null,"work_id":"eddec36e-99ae-422e-8289-c0df8f624de2","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.444482Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:efb6f82781a7a24b2214c5d74352a64181638a1e300ff8e089de29e3b1d679a8","observation_id":"65c7cf3c-ad1e-48a3-9b11-db09eec0c216","resolution":{"observed_at":"2026-08-07T15:27:25.547560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:23.547302Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.547302Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7d7db20c14939f9334e080d3d342b82ec42dc9f49bc35b037215ab88db9bca66","observation_id":"b627d61a-a152-452f-995c-31204b77cd52","resolution":{"observed_at":"2026-08-07T15:27:23.547302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.513723Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"851fb84e-2bed-41b2-89ea-ba8f2fd0954d","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.622499Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c9d75467966cc85642e4b6029a0aad7c91890d3c3dac516c69174163bbde3b05","observation_id":"2c2b7311-c0b3-49fe-b281-627080739762","resolution":{"observed_at":"2026-08-07T15:27:25.518625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.494632Z","title":"Pseudo-q: Generating pseudo language queries for visual grounding","venue":null,"work_id":"75e08f6a-12da-49f9-a152-5fb0ed676c81","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.665674Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:044eab9cec570f5eb1674ab37700e11cc66764d4e68bb02a254f1cae08643f1c","observation_id":"205c995a-911c-4833-b275-2ed85c45b5bd","resolution":{"observed_at":"2026-08-07T15:27:25.501505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.476959Z","title":"Refclip: A universal teacher for weakly supervised referring expression comprehension","venue":null,"work_id":"6aa95347-1535-4897-aba2-d30a6916bb13","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.705711Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:b418b88e0eb4621c0adba148603dc6f109af7fd6b0871ff11d26ae025275a164","observation_id":"23e2ac20-0386-4670-8441-e725202e18b6","resolution":{"observed_at":"2026-08-07T15:27:25.483022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.460585Z","title":"Mimic-cxr, a de- identified publicly available database of chest radiographs with free-text reports","venue":null,"work_id":"4ebf4f06-d504-4e95-b141-532132f07aee","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.812444Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:6ae5e0ef557f45145ca65a1494803e5c7a5e7b00c9f441298dece807d3f53617","observation_id":"23d3e97a-dec2-46c4-8633-6cdfb53afbdb","resolution":{"observed_at":"2026-08-07T15:27:25.466353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.442701Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"2d45e101-f4b5-4c46-9a1a-7765fd031614","year":2015},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.817389Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:de19801440b5320fc9659671713c3e32bb61074fd9416ce9255f166dd1cf9d2a","observation_id":"82a99970-fe6c-47fb-8cf2-2d81f45141be","resolution":{"observed_at":"2026-08-07T15:27:25.448618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.426636Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"46f89049-4e7c-46aa-8f4f-1f997c6c282b","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.968445Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:e73659cf01ddd8b03d7d5b7c66af1df904a264002696c90251c62b4b8daeda87","observation_id":"287b948e-d830-4489-9e77-4051caf9200b","resolution":{"observed_at":"2026-08-07T15:27:25.431737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.409069Z","title":"Covlm: Compos- ing visual entities and relationships in large language models via communicative decoding","venue":null,"work_id":"3d2ed083-96ec-4fbd-ab9e-8bfe9177d5ae","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.029605Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f08641263a7b4b808b0eed026eb46225114936d69a0a7d0d523260b7389a5db0","observation_id":"b82d452a-e73d-4a57-af9a-555d3a3f9dd0","resolution":{"observed_at":"2026-08-07T15:27:25.414889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.390742Z","title":"Visual prompt tuning for weakly supervised phrase grounding","venue":null,"work_id":"6ca8042e-e8fb-440e-8921-a0c69dbefecb","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.078264Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:66a5d406f6f6f14fbba6be5001482660ea13a767675920c919578b4f25157eaf","observation_id":"b2829c60-cba5-4903-9634-793a4d567bc7","resolution":{"observed_at":"2026-08-07T15:27:25.396323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.373518Z","title":"Adaptive recon- struction network for weakly supervised referring expression grounding","venue":null,"work_id":"bca407cb-e01e-48ba-bc9d-2b2095b94b0d","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.232523Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c6671c5245992085e467af24cbad3848fc0a82cefdc4fafa600185cf8f21f09f","observation_id":"2ee67b35-674d-4942-a788-9be5a328603e","resolution":{"observed_at":"2026-08-07T15:27:25.378739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.351052Z","title":"Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding","venue":null,"work_id":"5ef8858a-eb5e-4f6a-ae3e-e1e8179db747","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.305889Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:bf7d71d4177910087af49d2e6051fbfdf2ee4966252d5febf3a36e699f086d19","observation_id":"bd3c493c-7db9-4a8c-ba8e-cf7495e1f69a","resolution":{"observed_at":"2026-08-07T15:27:25.360884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.331363Z","title":"Relation- aware instance refinement for weakly supervised visual grounding","venue":null,"work_id":"19629484-8a50-4358-9560-b4066805213e","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.319662Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:023cbce46f3d0999c9ef8773f0016eb97f91dc53fa0464c560ce4a5224be4d17","observation_id":"a9045816-b320-4eb3-9c51-ff16d9985fd3","resolution":{"observed_at":"2026-08-07T15:27:25.337111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.312465Z","title":"Confidence-aware pseudo-label learning for weakly super- vised visual grounding","venue":null,"work_id":"d4bfaadc-443f-44aa-bc11-f17d63b64631","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.324978Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:62706b9eb87091b351fc1e4436de499d39258d8bb83034a4d94600550706af12","observation_id":"1d859626-93dc-4dd3-82ca-c0c28bb37c95","resolution":{"observed_at":"2026-08-07T15:27:25.318478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12694","last_updated":"2025-02-18T08:49:57Z","snapshot_observed_at":"2026-08-07T12:10:03.617047Z","submitted_at":"2024-10-16T15:54:11Z","title":"VividMed: Vision Language Model with Versatile Visual Grounding for Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12694","snapshot_observed_at":"2026-08-07T15:27:24.330648Z","title":"Vividmed: Vision language model with versatile visual grounding for medicine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.330648Z"},"links":{"cited_paper":"/paper/2410.12694","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c67d658e3382254811e24422b2f3b2586821f6028fd654c191a7e2c1f1836d94","observation_id":"93f57f9a-d121-4f39-9a95-0c1f6bb6c74b","resolution":{"observed_at":"2026-08-07T15:27:24.330648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.292662Z","title":"Localizing be- fore answering: A hallucination evaluation benchmark for grounded medical multimodal llms","venue":null,"work_id":"e5a1c3a4-3104-4246-a192-c718e5e0b5db","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.336043Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:167716bb7ae4a8c1cb3e3e142ef744c41f758eae352332e42a29f9e3d9e665e3","observation_id":"977ea515-a270-4cba-b964-5a0b941a946b","resolution":{"observed_at":"2026-08-07T15:27:25.300315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.275649Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"11420e0c-86b5-45cf-80b7-41d6bfa17b1f","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.340873Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:171fcddad3dafaad9cd8bdc8de2949687d590c3be600651d3883c17630ebda22","observation_id":"4a0688e0-c67a-46b7-be24-39e49f4f4456","resolution":{"observed_at":"2026-08-07T15:27:25.280907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.258077Z","title":"Decomposing disease de- scriptions for enhanced pathology detection: A multi-aspect vision-language pre-training framework","venue":null,"work_id":"b29ca59d-3388-48dc-a161-1470ade47086","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.346516Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:47f50997a7d0b67636d05b48817e0fbf39a57d4ac755ab5b69434131ac607dc3","observation_id":"19a626a4-e9f1-4c24-95b8-74e343a5220e","resolution":{"observed_at":"2026-08-07T15:27:25.263902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.233946Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"3942e821-483c-475c-a126-b381033e619f","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.352483Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:caaa812310db3937313e6fd914a061f4f0e05ceb70f33fc6cffe54bf1f5a0a83","observation_id":"82afdf19-dc02-4a02-993f-844e921fa15c","resolution":{"observed_at":"2026-08-07T15:27:25.241104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.357610Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.357610Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:6dee6a3b738214f8a323d55f1eb11d3608122343ef4aff3cb158068e04c4cf34","observation_id":"917bd957-09b4-4c44-9343-42590374f215","resolution":{"observed_at":"2026-08-07T15:27:24.357610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.200802Z","title":"Similarity maps for self- training weakly-supervised phrase grounding","venue":null,"work_id":"cc30beab-a07f-48f6-a6eb-c21f0ce07f7e","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.363051Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7febaaab82e3aaacd1a03f38ae2fae63a05ed002ad2e4b5a7f8cb7837d67dde5","observation_id":"16a025b8-aeca-4b52-aca9-e9ecc2c48134","resolution":{"observed_at":"2026-08-07T15:27:25.209336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.169467Z","title":"What is where by looking: Weakly-supervised open-world phrase- grounding without text inputs","venue":null,"work_id":"38133fe1-77c8-4eb5-a6a4-caa4fa564dfb","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.367722Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:b4ad8f254551a0644510afc87057e03a9d3cc64ebdf3a768d091eef687ca01da","observation_id":"690d67a2-a5e3-4e85-9615-04bbfad034cb","resolution":{"observed_at":"2026-08-07T15:27:25.175871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.144934Z","title":"Augmenting the national institutes of health chest radiograph dataset with expert annotations of possi- ble pneumonia","venue":null,"work_id":"9af7ad31-38d2-4e37-a171-df43b9f84bb3","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.372678Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:64e56b28f72dff964ce2df35383e2d04e97e66f2a9f9301843e667f20f9497f6","observation_id":"e5ce2b65-5e96-475b-b497-1113b6c1d868","resolution":{"observed_at":"2026-08-07T15:27:25.156053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03831","last_updated":"2018-06-11T06:58:19Z","snapshot_observed_at":"2026-08-04T17:24:56.824762Z","submitted_at":"2018-06-11T06:58:19Z","title":"Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03831","snapshot_observed_at":"2026-08-07T15:27:24.377929Z","title":"Interactive visual grounding of referring expressions for human-robot interaction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.377929Z"},"links":{"cited_paper":"/paper/1806.03831","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:e8117fe060db6e65d9313f4c99bdfdfb2118d5e844e3545be8fb09ffe823a7fb","observation_id":"e119af83-37ae-4cba-bc26-9d901ecd8ca6","resolution":{"observed_at":"2026-08-07T15:27:24.377929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.128092Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"4dffdc17-97da-4690-aa84-b5e6ba93b8bb","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.383868Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:ea7315a58346430c42e3ccddf7c32f9691a4bb362640005e3b711259fe5e952c","observation_id":"cb0858b4-f8df-4d3e-9e0a-3ca00d55e9a8","resolution":{"observed_at":"2026-08-07T15:27:25.133458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.110691Z","title":"Discriminative triad matching and reconstruc- tion for weakly referring expression grounding","venue":null,"work_id":"34ab55e3-1c60-4fb8-8586-b0c96686ce83","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.389140Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9ebb6e624c3eb921bb30542f4ae28268516147c19c2fdb4161d8f89ab6c58422","observation_id":"ccb34278-da29-4e06-be65-7b119fb95e98","resolution":{"observed_at":"2026-08-07T15:27:25.117289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.088781Z","title":"Expert-level detection of pathologies from unannotated chest x-ray images via self- supervised learning","venue":null,"work_id":"4e232718-91fa-4d8a-9653-15e9a29ec913","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.393936Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:daffc01f91746767a38a2c8409dabae88201280beb8593c6bd774da2df339ae2","observation_id":"80e253ac-89db-4816-8da8-b48324da3713","resolution":{"observed_at":"2026-08-07T15:27:25.094777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.067320Z","title":"Few-shot visual grounding for natural human-robot interaction","venue":null,"work_id":"713af0dd-684b-4aca-afcd-c9929681095b","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.399343Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:83f0f7f4817b80bd22b536f23e52bc2fd5857dc07d1d549f7aab8e3a32761d02","observation_id":"1b100858-ba70-4495-a5f6-861f0a986377","resolution":{"observed_at":"2026-08-07T15:27:25.073288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.045724Z","title":"Found a reason for me? weakly-supervised grounded visual question answering us- ing capsules","venue":null,"work_id":"a7a703b2-b070-41a1-875e-a9da08b028ae","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.404571Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7f9413c9b0076e57fbe77ac317fe59e73cdb3942a2cc62d538914ed2759d7767","observation_id":"d8a3026e-3615-4266-bbf8-f25eb2652c01","resolution":{"observed_at":"2026-08-07T15:27:25.054302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.020674Z","title":"A framework for interpretability in machine learn- ing for medical imaging","venue":null,"work_id":"acf7b600-fe74-404d-af0c-7049fafae567","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.409037Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:152a341302db9563ed7a426177b8a31f90fd86c322da516cb7792090ef77a233","observation_id":"cf6dc9da-27a3-4f52-981b-4c543d9ce71d","resolution":{"observed_at":"2026-08-07T15:27:25.028400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.000024Z","title":"Phrase localization without paired training examples","venue":null,"work_id":"3068804c-ec1b-4901-a169-28ea58f0029f","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.413789Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:2a19a5bbf28fa4d612d873b29fc37045600ea53ea957fefcebfac8617e7c3ea6","observation_id":"7ad7e45c-db9f-4730-a553-70c3cd68a6dd","resolution":{"observed_at":"2026-08-07T15:27:25.007002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.982572Z","title":"Improving weakly supervised visual ground- ing by contrastive knowledge distillation","venue":null,"work_id":"62195a22-a119-428c-9af8-656cc90a2a31","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.418799Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:016e2c1f494eaf0cdf8e7cddf0572baca561dc964e10a1d352cfc7ad30e8ccb6","observation_id":"37c9d7c2-2ae0-4e50-a5a8-59a3c52936ab","resolution":{"observed_at":"2026-08-07T15:27:24.989415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14563","last_updated":"2024-07-18T20:29:49Z","snapshot_observed_at":"2026-08-05T14:17:06.912465Z","submitted_at":"2024-07-18T20:29:49Z","title":"Learning Visual Grounding from Generative Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14563","snapshot_observed_at":"2026-08-07T15:27:24.423982Z","title":"Learning visual grounding from generative vi- sion and language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.423982Z"},"links":{"cited_paper":"/paper/2407.14563","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:04d5a771f8bbbdc0d670257d01b24c5170525caa32f6ccbe0eab498d317d8f8f","observation_id":"ca30bc45-839b-443e-be87-f652c7672f5a","resolution":{"observed_at":"2026-08-07T15:27:24.423982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.960250Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":"84165c17-1f81-47ce-bb6b-49ee0a7f5750","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.428888Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:61a88be1932284c8a4d1cb563e171840d154bf09c0739366fbcd381ff608b419","observation_id":"6cd49a2f-75b2-4ffd-af6e-502553d45a31","resolution":{"observed_at":"2026-08-07T15:27:24.968008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.935448Z","title":"MedKLIP: Medical knowledge enhanced language-image pre-training","venue":null,"work_id":"d16c4a23-3084-447e-8175-d20db0ba2eef","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.434362Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:97102472df7fbb37bd0c901cc130406a387818e697c7b00d6ee8d2eda85853f9","observation_id":"02e86381-a97b-45f9-b934-ef04de9e313c","resolution":{"observed_at":"2026-08-07T15:27:24.944750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.904352Z","title":"Rethinking masked image modelling for medical image representation","venue":null,"work_id":"686d3efc-96bf-4b31-8e84-83ccfe4445f0","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.439028Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:4028038db11eba5409e126ef4ac43a8a5b7a5bbb965d82eaf12df24341b177ed","observation_id":"33e89b3a-656d-4701-8a95-ac7aedea0b84","resolution":{"observed_at":"2026-08-07T15:27:24.918857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.14757","last_updated":"2022-12-29T16:36:55Z","snapshot_observed_at":"2026-08-06T08:59:22.727151Z","submitted_at":"2021-12-29T18:56:18Z","title":"A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.14757","snapshot_observed_at":"2026-08-07T15:27:24.445011Z","title":"A simple baseline for zero- shot semantic segmentation with pre-trained vision-language model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.445011Z"},"links":{"cited_paper":"/paper/2112.14757","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:0c95601eb28310410961f31c27af6419b205c6b48dc07180a40cb287cfb331a1","observation_id":"30f20f27-6e28-4288-9183-b534cf794ff0","resolution":{"observed_at":"2026-08-07T15:27:24.445011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T15:27:24.456585Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.456585Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f7f149db7b4ce52ba3df680a734d7b8277a80a58357fcee9fdcb4ea6e172f015","observation_id":"5e8a2ed7-223d-47bd-ad3b-74c5efaefb69","resolution":{"observed_at":"2026-08-07T15:27:24.456585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-07T15:27:24.462822Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.462822Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:5edd370fc7e2f8230cfc43fff84c3398f761372abf5d263d08bdea32726a9e63","observation_id":"451be5c3-98cf-4374-bf2d-95e02ae8352f","resolution":{"observed_at":"2026-08-07T15:27:24.462822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.468858Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.468858Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:66e3bc5220de82dab8cf4155170ea6d666d84e99465d6d66de09686e4971eaff","observation_id":"83ff10cb-5e7a-47e6-8c01-bef53e1fa1a6","resolution":{"observed_at":"2026-08-07T15:27:24.468858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.474354Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.474354Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9330d81ceae7c76af484495fe4857c91b3288d83d2554474ff89938ad26920f5","observation_id":"eab34838-7f13-4283-a369-cd5e76acf9e7","resolution":{"observed_at":"2026-08-07T15:27:24.474354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.865903Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"dc59367a-f576-47a2-9336-af6f77742930","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.480264Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:cd3b2568745ad09620331d3cb69b05f89403903e7096a49f57414f3f19a6a45e","observation_id":"5b435cc1-5157-4ef7-affe-9758d5f16013","resolution":{"observed_at":"2026-08-07T15:27:24.870915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4210.4120","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.670265Z","title":"Read before grounding: Scene knowledge visual ground- ing via multi-step parsing","venue":null,"work_id":"8f0ffc89-6702-4d52-b168-6693d8a23d1a","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.486647Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:0d4d274d65cde5de0356ba736e8df55319f98e347d8bd7e66dd1ef00ca07ab82","observation_id":"b85f18c6-6d44-4ca3-b5ba-e7ff031059ef","resolution":{"observed_at":"2026-08-07T15:27:24.680975Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.823591Z","title":null,"venue":null,"work_id":"7fc468cd-ba61-4b1f-8072-45583223110a","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.987649Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7100a64c8dea95f05a97734acbdf7bbb8c8aa0a569a0de3f87770344682f104a","observation_id":"82e14d23-428d-480b-bc92-1df061a0972d","resolution":{"observed_at":"2026-08-07T15:27:25.829109Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:21:06.525176Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":15,"verified_exact":2,"verified_fuzzy":52},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2505.15123."}