{"as_of":"2026-08-07T08:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c3a76d581e95ab68b83c142da6b406811c78ecc80e1f0105ea003958ce3a663","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:07:09.893269Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03322/citation-record","integrity":"/paper/2608.03322/integrity","json":"/paper/2608.03322/citation-record.json","paper":"/paper/2608.03322"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:14.337164Z","title":"International conference on medical image computing and computer-assisted intervention , pages=","venue":null,"work_id":"e450c994-6729-4ca0-afa0-54e4b868ff39","year":2021},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.291303Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:345089de4fc5cc2b77e74dcf25bdd8e231b42881315da14917ce5c897dbb6e44","observation_id":"8139d1e2-3c3a-4309-a652-b50b58240e49","resolution":{"observed_at":"2026-08-05T21:07:14.440464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:14.177502Z","title":"International Conference on Medical Image Computing and Computer-Assisted Intervention , pages=","venue":null,"work_id":"bf4c5a6f-4dc1-4ca4-ae9b-9fe75b00deda","year":2023},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.323838Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:a0f8f42f3e6b7e11200c5db4726e7f7cd4b6f4cca475226df55058e788d4d769","observation_id":"798da038-d359-4dd3-bc2b-29e39aaafa7f","resolution":{"observed_at":"2026-08-05T21:07:14.235802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.967372Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":"579074b2-aa18-41d9-b383-49843e2d5d44","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.354778Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:02ca7758d0785e3d2d409891389945661aa774ec0820ca1b533c03d039444c45","observation_id":"34ec7a43-e77e-4a12-864b-b65bc4ffd6fd","resolution":{"observed_at":"2026-08-05T21:07:14.039872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27365","last_updated":"2026-05-27T02:30:49Z","snapshot_observed_at":"2026-08-06T02:59:09.668446Z","submitted_at":"2026-05-26T17:59:12Z","title":"LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27365","snapshot_observed_at":"2026-08-05T21:07:07.387536Z","title":"arXiv preprint arXiv:2605.27365 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.387536Z"},"links":{"cited_paper":"/paper/2605.27365","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:174faa07481240cff008470236b96030c8ad9ddab397606e2334cb22110139be","observation_id":"f3ceb8d4-476c-4986-b790-39f15fb39ec7","resolution":{"observed_at":"2026-08-05T21:07:07.387536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.810923Z","title":"Nature communications , volume=","venue":null,"work_id":"3b9aadb7-f7cf-4a76-acb3-dfcfc8322d7f","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.433529Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:7f8eaec7b4a360dde405678e03d5efd1a9ad3a9faa3c1753a8b8600db1dec87e","observation_id":"6ec4edd4-a18a-4843-b5a9-59152b7a7b83","resolution":{"observed_at":"2026-08-05T21:07:13.872592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.668033Z","title":"Nature methods , volume=","venue":null,"work_id":"3227139b-3154-433d-af3b-82752caf515c","year":2025},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.468330Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:3c73cee8ae2f64a4e3133a0908d34e752e86e8061a71918b643181f9eb686c89","observation_id":"4f2736d8-74e2-4d5b-8d6c-91256a884cde","resolution":{"observed_at":"2026-08-05T21:07:13.738062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.519268Z","title":"international conference on medical image computing and computer-assisted intervention , pages=","venue":null,"work_id":"56e85837-72d8-4e8f-80bd-a9915064b0f3","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.508242Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:483b1d08935b90e620ecab6b7ea27e6081d0c62c68ba3a6f86bb38e0ffe565d5","observation_id":"59b2ecb1-120e-491d-b221-857adb44898f","resolution":{"observed_at":"2026-08-05T21:07:13.575409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08356","last_updated":"2025-06-11T12:15:03Z","snapshot_observed_at":"2026-08-07T05:10:48.880196Z","submitted_at":"2025-06-10T02:14:15Z","title":"MedMoE: Modality-Specialized Mixture of Experts for Medical Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08356","snapshot_observed_at":"2026-08-05T21:07:07.540354Z","title":"arXiv preprint arXiv:2506.08356 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.540354Z"},"links":{"cited_paper":"/paper/2506.08356","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:b7a65f3d829ee30d856437dcd1fc50901c0afbba0b5059a432db01bb857119e9","observation_id":"57e88c4d-9892-4f82-997b-395e7c3a7058","resolution":{"observed_at":"2026-08-05T21:07:07.540354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-06T19:02:04.617923Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04034","snapshot_observed_at":"2026-08-05T21:07:07.567191Z","title":"arXiv preprint arXiv:2506.04034 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.567191Z"},"links":{"cited_paper":"/paper/2506.04034","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:802ae9a92d204f148167b9fff5c77733c0a985112cde75327525869308d7979b","observation_id":"f388ae50-5da8-4c7b-828c-16459a5034e2","resolution":{"observed_at":"2026-08-05T21:07:07.567191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04477","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:10.757976Z","title":"arXiv preprint arXiv:2510.04477 , year=","venue":null,"work_id":"3affee6a-fdfb-4e02-9192-c12e1b2bff9c","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.598807Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:250c740f9f2221ccd1fea9192cf1eb145638deb8fd24412e5964e702f5f908c2","observation_id":"a2fcd220-4af4-4ced-9811-a1969e258422","resolution":{"observed_at":"2026-08-05T21:07:10.819578Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.412416Z","title":"Journal of medical imaging , volume=","venue":null,"work_id":"11d60164-354b-49d3-afdd-dee21f629148","year":2018},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.657756Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:5772012bbbd07ac91ea05e1b1a70ea358f36cefb5dc704137a501a331db2290d","observation_id":"2f6eb89d-c272-4b9b-87fc-d06fe82f5a8f","resolution":{"observed_at":"2026-08-05T21:07:13.464628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.693581Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.693581Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:403b0de6e2cb4477a4337460bef1567e421836bf527d2ee587edf867bd701b63","observation_id":"544d608b-642c-49db-8be5-36ac71182503","resolution":{"observed_at":"2026-08-05T21:07:07.693581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.291382Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"f4a43a34-ed48-4d56-9340-38ebecc67d3d","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.735063Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:aae66f12c9d480cc0c30858c7a999d6ea139d58d37e5d05d84dc2957dc116a21","observation_id":"7f3499f1-877e-4ae3-bcf6-7a721c8371a0","resolution":{"observed_at":"2026-08-05T21:07:13.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.074588Z","title":"European conference on computer vision , pages=","venue":null,"work_id":"e5b0521e-b6da-4b85-b966-21b7cec39dce","year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.778837Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:e7ac975c8a09445df809967fe33cecbae58c3d90906ac9071a729fbae6b93952","observation_id":"2bd2698e-bf62-4d58-94e7-124c85a2665d","resolution":{"observed_at":"2026-08-05T21:07:13.172153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.802293Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.802293Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:f0c748ea5351c82518257af42e0eb4b14910c4b0b589c4d41f9edffbf37aa54b","observation_id":"6a4eae3b-817b-4988-a3fd-315e68536dc9","resolution":{"observed_at":"2026-08-05T21:07:07.802293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.838697Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.838697Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:eabd8a512e5d2b18e0bde3d0cf864b00c8f3178352a9850105697f0d623da548","observation_id":"c8c46346-8a68-4dcd-8c56-1a320ba32416","resolution":{"observed_at":"2026-08-05T21:07:07.838697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.882591Z","title":"arXiv preprint arXiv:2510.12798 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.882591Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:f7a055a75e1e9b64378d05e993d5bd0586d37f19cc2360f05bdad61d9cbf42e3","observation_id":"a378364e-1e5e-42da-acba-05ca18c631c6","resolution":{"observed_at":"2026-08-05T21:07:07.882591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.926263Z","title":"2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) , pages=","venue":null,"work_id":"cfefe204-2b83-42e8-ba44-d3d7d4408b1d","year":2026},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.931795Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:a9d6a9ccd1c9bb19ae701cc9ba6a013fbcc0d99de41c2d804bdf892f3351d97a","observation_id":"085a2332-2867-4624-a043-da1bf3de5719","resolution":{"observed_at":"2026-08-05T21:07:12.986260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12694","last_updated":"2025-02-18T08:49:57Z","snapshot_observed_at":"2026-07-06T19:34:41.712266Z","submitted_at":"2024-10-16T15:54:11Z","title":"VividMed: Vision Language Model with Versatile Visual Grounding for Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12694","snapshot_observed_at":"2026-08-05T21:07:08.007254Z","title":"arXiv preprint arXiv:2410.12694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.007254Z"},"links":{"cited_paper":"/paper/2410.12694","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:4100f93a8945b16cd35921292d2eedcca6bb2d9304c9ed5ee4cc041baa117551","observation_id":"110f6385-b605-4c39-94a6-bc57dde51b2b","resolution":{"observed_at":"2026-08-05T21:07:08.007254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.824676Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"0766d34a-c5a3-46f3-9532-27c6169bf366","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.069248Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:56f22de6e447c39558e122a476d45880e3d100668182a8d87a2ff965e277e06f","observation_id":"49ad6160-661a-4c88-b080-3bc11726618b","resolution":{"observed_at":"2026-08-05T21:07:12.882338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.727619Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"fa8d97a9-a0b6-4d45-a727-6fb9855cfc54","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.158591Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:077476784e24a28124c9ae80353572bb7579e09dca5bde6218023a60cf4e1fa8","observation_id":"92b64d50-bfb0-4007-8452-c2d84cb062ac","resolution":{"observed_at":"2026-08-05T21:07:12.776827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.587588Z","title":"Nature Communications , year=","venue":null,"work_id":"8bfc45fd-b507-48dc-9ff4-388301f12b98","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.218339Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:bc0b835c620cd8abc19cb3e020edd04fac2077bfb0b6132478c0bcb9e7dd98aa","observation_id":"539ca9fe-d91c-4f3f-8426-223cdba068c4","resolution":{"observed_at":"2026-08-05T21:07:12.672341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.287875Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.287875Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:2be0ac181cc0b57f929ee9018e2fe22bb07412778592d673bd15e0ca000d86ed","observation_id":"3652678f-b974-46c2-a861-824a124d0c48","resolution":{"observed_at":"2026-08-05T21:07:08.287875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.385821Z","title":"arXiv preprint arXiv:2601.06847 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.385821Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:7c26ea6b23f7dabf4d4f7654683ecfa315371487fc1e9d4bb86b252dec1f61bb","observation_id":"d0f5a677-cf76-4f15-b909-147757ebb773","resolution":{"observed_at":"2026-08-05T21:07:08.385821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.406736Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"87f39a0a-b63f-49f6-adf1-0321317aaff0","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.421805Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:c9b03dafe37b593436a3fa66ef68652fd877f74a2b1cdc153bf535f1dedada1f","observation_id":"bfc923ed-8082-4118-8eb6-30463cbad083","resolution":{"observed_at":"2026-08-05T21:07:12.461937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-06T03:54:12.027415Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-05T21:07:08.465735Z","title":"arXiv preprint arXiv:2505.14231 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.465735Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:14707863c53d3a936d62686027df833a4b57e665f86daa5bdb3487d1d8d37e09","observation_id":"c88710ae-06f9-4c58-bc6f-b9a7e8c8a542","resolution":{"observed_at":"2026-08-05T21:07:08.465735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.242463Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"4b98323a-d754-4437-998b-6fd617a44af1","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.521244Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:188d000747ac24522c4ad13b664b7d3f095ce9652c27821a713e942b022071f7","observation_id":"0021fea5-eb31-41b4-b5db-4ee7239a1c2d","resolution":{"observed_at":"2026-08-05T21:07:12.310068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.06665","last_updated":"2026-04-10T08:38:35Z","snapshot_observed_at":"2026-07-06T22:48:08.821342Z","submitted_at":"2026-03-02T10:32:44Z","title":"Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.06665","snapshot_observed_at":"2026-08-05T21:07:08.563485Z","title":"arXiv preprint arXiv:2603.06665 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.563485Z"},"links":{"cited_paper":"/paper/2603.06665","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:000a1c3bdc6e270942b117aceb323ab22a23381d7cd98b6e3cfc77237b133c46","observation_id":"7baefc8b-2614-44e4-84bb-7fa50f48fa78","resolution":{"observed_at":"2026-08-05T21:07:08.563485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.634558Z","title":"Nature communications , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.634558Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:baed39e6fb16582bcc525d1bcc61f4e6560eee05156d9ae5b2fa469f00d8be26","observation_id":"0cdb2e9e-7bca-4770-9a48-2ba6af965c1b","resolution":{"observed_at":"2026-08-05T21:07:08.634558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.695541Z","title":"Radiology: Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.695541Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:995df955a8596799058d71a1e63cea6125b3812bbea4f24a228f84361389ffd6","observation_id":"98196b98-4ce3-4d47-94f3-30ac11d264a5","resolution":{"observed_at":"2026-08-05T21:07:08.695541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.748748Z","title":"Medical image analysis , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.748748Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:1110d1f3717c80f64158cc6529ceee4c134e607b01f224b5af19f7f9a2ddbd2d","observation_id":"b9446222-422b-47a8-bf0e-47cd25906429","resolution":{"observed_at":"2026-08-05T21:07:08.748748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.024208Z","title":"International Conference on Medical Image Computing and Computer-Assisted Intervention , pages=","venue":null,"work_id":"82abd405-a94b-4569-8d6f-c2df80824f62","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.786746Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:8e20f9ba1a179774ced4ab8e69b27ba7a83485d2c24a4b338a1ac33b0696fc9a","observation_id":"e28eec6a-38e8-4e3f-b8bf-f709c7521296","resolution":{"observed_at":"2026-08-05T21:07:12.099143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.859374Z","title":"Medical physics , volume=","venue":null,"work_id":"d2580387-23b4-4768-9197-60141efb56be","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.815007Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:3589e207d086fdc2c494724158a320bb526781d9002cac84f7e095cedaec1dd1","observation_id":"3728f14f-26b9-4c6b-b8b5-5b7838536633","resolution":{"observed_at":"2026-08-05T21:07:11.934478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.666701Z","title":"Scientific data , volume=","venue":null,"work_id":"fe17dcf7-c69b-43fc-9540-fb078f0ee5ed","year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.851524Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:6d4b5c70ae1f4a8faf4c9467d83114ef64b16b6bfbca481275e000ff214d51e7","observation_id":"886c2177-2804-4377-a1c5-8790a793c558","resolution":{"observed_at":"2026-08-05T21:07:11.770374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.490981Z","title":"Scientific data , volume=","venue":null,"work_id":"8cc12d20-9edb-42e6-b027-c147746728dc","year":2023},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.877954Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:f06de9047e07f4bce3dc35369249f662fc4cbe4bce5c5d325a7a43ec393bfa50","observation_id":"160b1582-f6be-48de-a60d-5ff7ccd42fd2","resolution":{"observed_at":"2026-08-05T21:07:11.537733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.919218Z","title":"arXiv preprint arXiv:2305.19112 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.919218Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:55811e9013fb45c616d4e0d96fac1e57bd3eeb5bacea7ece45eb07858e4e614b","observation_id":"53f19895-266c-44f3-b1cd-03a41cd2adbe","resolution":{"observed_at":"2026-08-05T21:07:08.919218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.948707Z","title":"International conference on multimedia modeling , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.948707Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:7a80c40540288934e27e73ddb2c6feaf4ac9d48ca5d989231b89009e53d4bcb4","observation_id":"c8535cf8-1809-4a3e-8a35-262a22cdbf41","resolution":{"observed_at":"2026-08-05T21:07:08.948707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.356554Z","title":"saliency maps from physicians , author=","venue":null,"work_id":"79ec71d4-f0df-4278-b6e9-043591bd38a5","year":2015},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.996716Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:ee0e35023ea7381b2f1b3c8e12c0f983e058cee2825a5b003a6b326afabdc873","observation_id":"ee625d8d-b7fe-43bd-bcf2-062ab53d7f6f","resolution":{"observed_at":"2026-08-05T21:07:11.392202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.271869Z","title":"Information Sciences , volume=","venue":null,"work_id":"5d8d5675-c9af-49b5-8d2c-a23739a09cec","year":2019},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.028296Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:4d2fdd7e996f6c09e5e945c2f89fb805c2a58d294656ff38d41d7a6b19a8411c","observation_id":"7cade63a-ecd3-4fc1-9294-c121ba9e450b","resolution":{"observed_at":"2026-08-05T21:07:11.308346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.197739Z","title":"IEEE transactions on medical imaging , volume=","venue":null,"work_id":"97bf0c74-4a39-4721-be06-da13605142c3","year":2004},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.065811Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:e2ba1b482808caa12ac7c8859e60bff8a3845d8acbc17201267dad6092ecf1c4","observation_id":"c60c39ba-7f7b-4009-bbea-c50fe9b3cc2b","resolution":{"observed_at":"2026-08-05T21:07:11.227731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:10.944746Z","title":"IEEE Transactions on Medical imaging , volume=","venue":null,"work_id":"774842ac-5e87-4105-9a3f-990a05cea8b3","year":2000},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.098336Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:6907e3fadc91c9942e4e2e5eb02fa37dd4ea2dc36efb6f8b1facea06e3bdfd17","observation_id":"5dfb962e-91c8-4480-b4ce-152c824890a8","resolution":{"observed_at":"2026-08-05T21:07:11.062611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:09.170037Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.170037Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:c232e6870082b5a7eae2f25fcce31020ed7f531b2190f1a2f926b0ff53e7ed7e","observation_id":"efe2f606-036d-4080-978e-e841ff6e7743","resolution":{"observed_at":"2026-08-05T21:07:09.170037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03748","last_updated":"2026-06-02T15:01:13Z","snapshot_observed_at":"2026-08-01T09:23:30.473562Z","submitted_at":"2026-06-02T15:01:13Z","title":"Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03748","snapshot_observed_at":"2026-08-05T21:07:09.213500Z","title":"arXiv preprint arXiv:2606.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.213500Z"},"links":{"cited_paper":"/paper/2606.03748","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:173ff13a474935f20e85a3683ac9a6a58fcd287e362ffe9192c89d0043b26c05","observation_id":"9d5ab858-d88d-4c63-bfa5-96bcbb3c514d","resolution":{"observed_at":"2026-08-05T21:07:09.213500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03459","last_updated":"2024-06-05T17:07:24Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:07:24Z","title":"LW-DETR: A Transformer Replacement to YOLO for Real-Time Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03459","snapshot_observed_at":"2026-08-05T21:07:09.302031Z","title":"arXiv preprint arXiv:2406.03459 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.302031Z"},"links":{"cited_paper":"/paper/2406.03459","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:9bbc1806e0c02e34eb6458191084cc0aefe2b2160f4006be86ad16e50e655e6a","observation_id":"a9cd5b55-8b47-41bd-be3f-a25d42f77648","resolution":{"observed_at":"2026-08-05T21:07:09.302031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.18739","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:10.207521Z","title":"arXiv preprint arXiv:2603.18739 , year=","venue":null,"work_id":"47f1ab39-79cf-43c8-9b2e-c02435f3db82","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.384132Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:f892a27c375921525545470c03cce42842e4001b6e74fa96990f492f8be7823a","observation_id":"6c6cbf1d-23fb-4ccb-85cf-f5d563015e11","resolution":{"observed_at":"2026-08-05T21:07:10.299260Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-05T21:07:09.449564Z","title":"arXiv preprint arXiv:2412.10302 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.449564Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:4a1291df3dc53d5a84d4a9cc7d8583805dd4108370cfba7e7f25f9ac8f29bccb","observation_id":"cb508499-4c1a-41a4-a672-9f366aa90408","resolution":{"observed_at":"2026-08-05T21:07:09.449564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:09.599566Z","title":"arXiv preprint arXiv:2512.17436 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.599566Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:b820d9b0b26b50d7276edd75994918564437e9544d07503aa7f1a768255ae539","observation_id":"db45a968-61e3-45d5-b5c7-a97ac6f009bd","resolution":{"observed_at":"2026-08-05T21:07:09.599566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-08-05T21:07:09.717152Z","title":"5 technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.717152Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:60530534f53a6b2a7663c061a851e3af2320f05da7ecab193b2c88c626ed9cce","observation_id":"07a1f85b-7386-431d-b18e-40ed5284516e","resolution":{"observed_at":"2026-08-05T21:07:09.717152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T21:07:09.893269Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.893269Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:156f9e2377ede8b527d82494fc6e5ab1206404b1bd171cde24ee66bb406f32c3","observation_id":"6ebcfbae-2f97-459c-9f74-b717d95ccad2","resolution":{"observed_at":"2026-08-05T21:07:09.893269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:17:29.122021Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2608.03322."}