{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:145e2d2b440ca6f464f4f6722a6c06b13b997eb8577f1e0acab04f381d8191b4","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T03:25:43.795795Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.06534/citation-record","integrity":"/paper/2606.06534/integrity","json":"/paper/2606.06534/citation-record.json","paper":"/paper/2606.06534"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"METEOR: An auto- matic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:1dd4cd0932b3eab46f68ddb3e826dbd2bf5ee5591fc4e2db4ee1180aebdaeda6","observation_id":"74d47ca5-2c91-4fd7-9135-13ebe0635bce","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Saliency-driven ex- plainable deep learning in medical imaging: Bridging visual explainability and statistical quantitative analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:ef882a30fd91bee75cece3df18002b1cc24dd52d5fd5fbafa0bc2de534a70d83","observation_id":"2b2a52be-90a6-47cc-981b-714cc74ff394","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Swin-unet: Unet-like pure transformer for medical image segmentation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:12f6c906649496f6f003c0503d19fde8c07f2bfa9629847587f90184e32a4f38","observation_id":"51275b1c-441c-42fe-858a-14b0949f2acf","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Yuille, and Yuyin Zhou","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:a8edcc3607ff2aae6d83bed3cc0a1024f452ce91f70ae594bfbff7fdd07a60f3","observation_id":"91f781fa-0d2e-4c96-a0f2-1faa47920e78","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Pretraining vision-language model for difference visual question answering in longitudinal chest x-rays, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:7774fc4d10597a5752c32c980d1b118102a699992a30c5d8e458f192a70e2850","observation_id":"7bd4b319-66be-4d07-bda1-d3f45ae4f9ca","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Co-saliency detection with co-attention fully convo- lutional network, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:b8c360291d936ee142234fecb95b43ab6f39e07d86653845e75ab5100597f91a","observation_id":"bc9f6c91-c73d-42d2-ba16-e37b245fb42e","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Goldberger, Luis A","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:f6fd1f7ebfacdf05d1c438814c997bca4ea02bf25f88edcd8c7ac9aaa7d1f838","observation_id":"d181d43a-b611-4f7b-9ebc-9baad5b07ae4","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Unetr: Transformers for 3d medical image segmentation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:474b94db3ba190c3b907f1fbc7a8afa51779a85f84638feb48b927cbd50d676b","observation_id":"c86a62c0-8ce1-4c15-8aae-0d70fe088e7c","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Medical-Diff-VQA: A Large- Scale Medical Dataset for Difference Visual Question An- swering on Chest X-Ray Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:66437312095a611ca7c2d987bc59e5e312038e8512fce2acbd7c64744cc8d959","observation_id":"e3fe7c9d-c58e-420d-8700-a1da7bf06f7b","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Summers, and Yingying Zhu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:2ade0f8153463e3316df7b294e2a935271acb424807a1f2df2672a8515846efb","observation_id":"6c9d75ea-3233-47f6-98c4-78a0b99edb59","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Lungren, and Serena Yeung","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:1393dba7579105fbebf1ffba7c8a9f7089eb4193bafb1bdbbafea1b09d7f85ca","observation_id":"11dc461c-1060-4c72-9d04-ef181bcdabea","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Elsabawy, Alaa Ebraheem Elnakeeb, and Nora Elrashidy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:ea303f61584928fcc0f8f88f856626747f0b785965c89a238df4f63e8dbf1886","observation_id":"934357a1-b883-4a80-93ac-f370c87c1121","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Jaeger, Simon A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:f40bae005adf42883d080acdfc062a6745d2a97e85a58567e07192d1d74722b5","observation_id":"27c63b98-c214-46b1-b89a-2cdd05acd10f","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Spatial transformer networks, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:97a2f71a0fd7d6d7003c87f98c0eb0d62d14c0574e32df43a052b21157dc91ca","observation_id":"fde7716b-f967-4b1b-a077-940cebdcc29b","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"One map does not fit all: Evaluating saliency map explanation on multi-modal medical images, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:50e89adb07408fc5885a0868ffd4e95ae8e20cb2630390e0d55a62d4cca22aff","observation_id":"0523bd36-fb98-4235-93fd-531a21b51864","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:ebce72f8177db5cc88a629110d6d34ae07a51d46fa1db1a1bbb8d45e21fc48e9","observation_id":"d5a853e3-44ae-4802-9425-e56c169b3966","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:ef96d4481aa188eba7e19e6453cfdb946e484dc145d4cc66f3f062435106fa26","observation_id":"b4688c77-7f5f-4380-874a-6b81748c4380","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Schroeder, and Tolga Tasdizen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:9d26033f7c85d5181f0d487d8211a796645a04cf90feab9124cd026a7506f157","observation_id":"8220432c-8e88-4bc3-a533-d3fdacf5f3a5","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Llava-med: Training a large language- and-vision assistant for biomedicine in one day, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:df7d124a88191c52fdf7617bbe66c34cef4c2d10f350f57c5a0f1b1dd453d2b9","observation_id":"1f53a779-0798-4d8b-85d4-034fdb709b7a","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Meddinov3: How to adapt vision foundation models for medical image segmentation?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:fcd18a04ea145acb34dd0fd1718642a57febe00be600d80853b077c8365350c6","observation_id":"c2ee01bd-0e98-4943-b73a-93bc9cdf388b","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:f5cb9b98b612d240050ac4d4ba3b03b352fa6bceb80489e141c933ba142f6e09","observation_id":"b6c84719-01e2-456f-9302-b544575a68be","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Medical visual question answering: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:216c21aa5849f47fa1ab39e0a66ad859e1f08af51572db786efb8751d9d27e2a","observation_id":"97f9b9d2-3043-4489-a972-1ad9f0f42121","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-07T00:32:15.123562Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"cited_work":{"arxiv_id":"2103.14030","doi":"10.48550/arxiv.2103.14030","metadata_source":"pith","pith_arxiv_id":"2103.14030","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","venue":"cs.CV","work_id":"d6d2cf36-1b48-40c9-86e8-1d5666324ae1","year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"cited_paper":"/paper/2103.14030","citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:37cfe11c4703fb91de103105701fd5d049d87c754788c5c0e20cef4ba8f11a2d","observation_id":"1869c21f-ae86-4b43-b53c-d7fa1b948aee","resolution":{"observed_at":"2026-07-02T11:36:55.007448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Thakoor, Padraig Corcoran, Ying Chen, and Hantao Liu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:e9724cae10f8ec92ad9cb857fa69cca5bfb08f5dc2dda4047a65127b4cd3cadf","observation_id":"e04beac6-0512-4291-82ff-5d90dc46169a","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Spot the Difference: Difference Visual Ques- tion Answering with Residual Alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:1402e6e3747f7db898617846895c7746304570f45479751adce47e3377c9cf3e","observation_id":"39f84702-46da-4619-a97c-15148d71ed61","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Segment anything in medical images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:bb806370c26f907da8d6436224589213322f2919369eb3d34bffe819c2b0655b","observation_id":"054d7f9f-76c4-4fc1-9a2b-c4b963f59e03","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Unveiling differences: A vision encoder-decoder model for difference medical visual question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:cd19e26501b2773c9ba9610579c85a010ed2d4902b889807885630c74c308f12","observation_id":"95b9bcda-96df-4f2f-b010-ca3fd161dde5","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Lon- gitudinal change detection on chest x-rays using geometric correlation maps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:41fa8e5fbd115c2dfe30d18bf4c713bb7233ccad91ab184e96fb989de7aff215","observation_id":"264c93f3-360f-451d-8c74-1d24535bbdec","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:69583c0224e679e1f22bcaefc0bc442b91ebb7a9cc0374a66fb1dd93fb185230","observation_id":"88a22f4e-59b4-4205-81ff-69b79861cfe1","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:2b7e5f34953c9e2d797c339f08327954fc88dbff2b3d94d3436638feb69a8e53","observation_id":"84981248-b1dc-4cbd-86d2-b784145ffa63","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Castro, Anton Schwaighofer, Matthew P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:01ced8cdc2385919474e11e3e392c90cf703aa3c7ef3587cb257184b88dacb64","observation_id":"18544029-ce04-4f5c-baff-4e53f8dff19c","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:9ca20bd08076669c6fc51663e47f3adc8efee86803316d4d656582ff554b09a6","observation_id":"591b912d-04b2-4651-a75c-3a7b14d4efc5","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:160fc5ffeae9fa430790fcef6dab1707541b784808855e33dfd593c4b1f76af9","observation_id":"02876894-caf1-4aea-8e3b-f09242f8ff4e","resolution":{"observed_at":"2026-07-02T11:36:55.005058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:3a676b046be1023b372cb27f8597862c5dab02e64232cca05205fd9fa68702e9","observation_id":"e278d090-5dee-4d61-a74c-3a428e676e0a","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:85c8da93b1048d8931f766b5d5d875b1066e7aa8d62a881333d44e3b61bece44","observation_id":"bdcb7e87-9a8c-4d19-b475-71c4813e17fe","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Peeken, Daniel Rueckert, and Benedikt Wiestler","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:3088eda0440c57582b9ab75826c9a172070cd4cd46f6eb9c70af3b75f3162be0","observation_id":"8728e0ed-05eb-4e73-a973-b16ac678f260","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Ba- tra","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:7c6136f14a2894a81bcf40669dc1b39a66670faee7713f934e0446774763030c","observation_id":"622e632b-0da0-4e91-b66a-39d2d35b899f","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:046bd989f718aa5ce02c01d4f779b6fa3c68ac1383d3ba9fbb417bbc9d8666ab","observation_id":"077699b7-b671-4dd8-b622-4844c7919fd8","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"General pur- pose image encoder dinov2 for medical image registration,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:a9c96d190c85862e0daf93843891135c432bf7df6d7af868460fba5512b79287","observation_id":"bf188445-87e5-498d-8228-447902e4cfc3","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:4d660d1d5eec7a1b528f136f68db24c49e2d809869b0b9fcfb9766f434e3e102","observation_id":"3c421942-e1cc-413e-a010-d6004bea366f","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:c933b5763c3a703a8efb48cc17f21fca54d7b17574101a214dc5dcb2b79e6493","observation_id":"5860de1d-01fc-4911-9a7a-1468c976362f","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Co-attention aligned mutual cross-attention for cloth- changing person re-identification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:d93be4e929a565d820f1ae8db5d1d9b1fe9d82c48b882ebd70923fe2fd565e8e","observation_id":"ba046c6d-d957-4f3e-b218-e80c04d7e89e","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:bf95dd660d2016e749e6e10408bb8b4fd9254c5c441442dc5fe21b17d7841210","observation_id":"f1749510-a4bd-4b68-921c-979ad0171957","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Sabel, and Tobias Lasser","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:6ad81ce9eb98e29f9b7b1241bda39c4fe7ef6712d0105f588ad92bb3caeeb764","observation_id":"84550c3e-a025-426c-b595-d866e21a55a7","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Segdino: An efficient design for medical and natural image segmentation with dino-v3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:e8b2bb6d847cceb55dc762a15d4f19371ccb46cd739fecba7cd9505bf285cc81","observation_id":"e985809a-19be-4a5d-83e4-2e69caacb30d","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Exploring visual relationship for image captioning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:8f1d17db04bd65d27af0e231167814018e8c42b5294927f2fd8626d11d4032ae","observation_id":"ed7e4634-fac8-4f3c-a633-5b7e58a22d88","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Describing and localizing multiple changes with transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:255688c5b21a2c46a9e748963f5699980c8d63d5e641c92a4a793a5f1c6fbfee","observation_id":"2bb3aff1-5a06-4a3d-a5e6-03b2ec3248a5","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Mazomenos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:77d63288431b6f23c57d90b554d285ac8279a4b8ae3fb6055c4edc4c0504bdc0","observation_id":"6562b13e-0276-43d4-9b18-bc9c44f5c405","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Lungren, Akshay Chaudhari, Ser- ena Yeung-Levy, Curtis P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:43457990f00b229a4b667ea03007a54edc31d8b79aab4fe9b07dcdcae82ab101","observation_id":"0e20a436-75d9-4705-a7d7-47152ef41d91","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"PMC-VQA: Vi- sual instruction tuning for medical visual question answer- ing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:b3af494e7c5b44a69cf58e346a8271248f20a946e6931dea628b7d55271397f9","observation_id":"415f5052-df69-4804-a1fe-c2197f10a732","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:25:43.795795Z","title":"Medical sam 2: Segment medical images as video via segment anything model 2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T03:25:43.795795Z"},"links":{"citing_paper":"/paper/2606.06534"},"observation_digest":"sha256:9cdd93cd0af97c2ecededdb26fe56e8581de479c83f76f3f5769f62f6ec87040","observation_id":"90c129eb-c1cd-4b8c-bdb8-b777f38ed186","resolution":{"observed_at":"2026-06-28T03:25:43.795795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06534","last_updated":"2026-06-03T18:12:19Z","latest_version":1,"primary_category":"eess.IV","snapshot_observed_at":"2026-08-07T00:32:34.628263Z","submitted_at":"2026-06-03T18:12:19Z","title":"Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2606.06534."}