{"as_of":"2026-08-08T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fc9cef09c32875a87210d1267bab5328214d4ead996c69f21fdcd8ac5d6cc84","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:02:21.165503Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08990/citation-record","integrity":"/paper/2506.08990/integrity","json":"/paper/2506.08990/citation-record.json","paper":"/paper/2506.08990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.773766Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.773766Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:e3e3a7036ad159c58f34104b2d71e9d5f35d9fde004d31e471f7e8726c4c282a","observation_id":"9fd25426-9bcc-4eb4-bee7-b13f40e3ed74","resolution":{"observed_at":"2026-08-07T05:02:20.773766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07042","last_updated":"2019-11-14T17:34:51Z","snapshot_observed_at":"2026-08-02T04:11:08.699777Z","submitted_at":"2019-01-21T19:01:00Z","title":"MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07042","snapshot_observed_at":"2026-08-07T05:02:20.823905Z","title":"Mimic-cxr-jpg, a large publicly available database of labeled chest radiographs,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.823905Z"},"links":{"cited_paper":"/paper/1901.07042","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:7b31d102a98fdc40ad429960ce88d681fc0730e44d985a8848fec905a9e28507","observation_id":"247791b4-f9dd-4f94-8849-25c385551f2c","resolution":{"observed_at":"2026-08-07T05:02:20.823905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.997639Z","title":"Chestx-ray8: Hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases,","venue":null,"work_id":"f6ee2cbc-884b-4ee4-899b-932a52126679","year":2017},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.873856Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:b911417e01c2f119d89043b8cd398237bc2ac1d687bf77773e67421fcf098a07","observation_id":"9de23ca4-edcd-4f77-a29c-69e2200a2b5a","resolution":{"observed_at":"2026-08-07T05:02:22.003020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.981360Z","title":"Chexpert: A large chest radiograph dataset with uncertainty labels and expert comparison,","venue":null,"work_id":"1187452c-00a4-431f-b428-b96562eb91cd","year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.929274Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:87b143ecd259a704b1880e2c9d81c3c41b00ec5c84754f0b8b78754d5a9fb2d7","observation_id":"dad709e1-77fc-482f-9a7b-e01b3d739726","resolution":{"observed_at":"2026-08-07T05:02:21.986416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.949952Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.949952Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:8dee07d430604361df769fc5c0e824a0b7b387e8b6dc22a375ec7843759590cd","observation_id":"e8d136c1-2ca1-422c-9dac-c5d1403ff169","resolution":{"observed_at":"2026-08-07T05:02:20.949952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.957238Z","title":"Contrastive learning of medical visual representations from paired images and text,","venue":null,"work_id":"74947619-3794-42ca-9e49-4d71b5283004","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.954272Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:bc6aecdb42cafcb12f1baa2e3f8b8a2200be5d9f58a94d40ddd4677966497c4b","observation_id":"76f20c04-0ca6-4e17-98a2-cea9eab6695c","resolution":{"observed_at":"2026-08-07T05:02:21.961508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.943770Z","title":"Gloria: A multimodal global-local representation learning framework for label- efficient medical image recognition,","venue":null,"work_id":"4a367c7a-e791-48b8-ae19-e92a2c5ee27b","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.959477Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:a8506ad86be6fb40fc43bfd5ef85e5d431a25d951f8576e48640d8fde196e88f","observation_id":"72dc1b6d-e7a1-497c-824a-7adabb02216a","resolution":{"observed_at":"2026-08-07T05:02:21.948018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.963272Z","title":"Making the most of text semantics to improve biomedical vision– language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.963272Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:19729e23d00d51c985846fb728c61d802e5803714c697605151b28b0bfd30688","observation_id":"45fb1f3a-ccf5-48ad-995d-7bbbca04886e","resolution":{"observed_at":"2026-08-07T05:02:20.963272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.918948Z","title":"A multimodal biomedical foundation model trained from fifteen million image–text pairs,","venue":null,"work_id":"de7a3270-fc4f-4a62-9578-df67d96eaa27","year":2025},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.967837Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:5d412a4f1a626c63a465953fb7af67913935324f2415c5acc932d096e48628c4","observation_id":"e3ef6427-e5b4-4135-9c46-d39e5e22dc4f","resolution":{"observed_at":"2026-08-07T05:02:21.923279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.905063Z","title":"Advancing radiograph representation learning with masked record modeling,","venue":null,"work_id":"21a508ec-5b33-401d-9177-3e319ae9a545","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.971917Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:1f847e13fc8251b86228cacc91b8d48a11c30ba061914b050ba48e197571f20f","observation_id":"ac4bc219-aaac-4734-8b41-47db5935ee65","resolution":{"observed_at":"2026-08-07T05:02:21.909308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10815","last_updated":"2025-02-07T12:03:23Z","snapshot_observed_at":"2026-08-05T01:30:51.584747Z","submitted_at":"2024-01-19T17:02:17Z","title":"Exploring scalable medical image encoders beyond text supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10815","snapshot_observed_at":"2026-08-07T05:02:20.975873Z","title":"Rad-dino: Exploring scalable medical image encoders beyond text supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.975873Z"},"links":{"cited_paper":"/paper/2401.10815","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:1b773559f4f7b85d7c67077ff8b23a15c2d226e0730b4987e755fe05df931bb5","observation_id":"1944ea8f-beef-46cf-a372-fdb3f8bab1c2","resolution":{"observed_at":"2026-08-07T05:02:20.975873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06224","last_updated":"2023-12-11T09:14:13Z","snapshot_observed_at":"2026-08-04T02:51:44.192470Z","submitted_at":"2023-12-11T09:14:13Z","title":"Medical Vision Language Pretraining: A survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06224","snapshot_observed_at":"2026-08-07T05:02:20.981003Z","title":"Medical vision language pretraining: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.981003Z"},"links":{"cited_paper":"/paper/2312.06224","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:4c08880b1f3a5d327524e7af0fbd5d59ab4b382ff4e9c94c66cdf77a8743a88c","observation_id":"cf92113c-2d18-48dd-ab23-d108399a51d8","resolution":{"observed_at":"2026-08-07T05:02:20.981003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.891140Z","title":"Unichest: Conquer-and-divide pre-training for multi-source chest x-ray classifica- tion,","venue":null,"work_id":"dbb129a2-0dda-4189-876b-c98ac822ea48","year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.985555Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:bd672e2379fe973e601da94572ffcf690f06533c4a458ecd1a4a243ef58d2b9f","observation_id":"1e88a606-8554-46d1-b82d-162313e4065c","resolution":{"observed_at":"2026-08-07T05:02:21.895563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.877124Z","title":"Im- proving medical vision-language contrastive pretraining with semantics- aware triage,","venue":null,"work_id":"0a7052df-2b39-4226-992c-cf978ec5149d","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.989976Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:cc01ba9b9da7d901c1646e16c87426d3e623cf98139620528bba1efd5214ef7f","observation_id":"36067afd-f3b0-47bd-aa4f-44169d599346","resolution":{"observed_at":"2026-08-07T05:02:21.881471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.862745Z","title":"Exploring scalable medical image encoders beyond text supervision,","venue":null,"work_id":"61db241c-eecc-4aab-8ee7-6682325c0b26","year":2025},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.993776Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:76ef6de585888fa645989ab929cc42e36f1a16e70e81c02d7b335adb88bcbcac","observation_id":"6d72bb59-ce72-44a4-9a8c-fad5114fa252","resolution":{"observed_at":"2026-08-07T05:02:21.867278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.998341Z","title":"Learning to exploit temporal structure for biomedical vision-language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.998341Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:fc0aa51a7135aeaae8c6d64f0f13059e78b018f5ef06aa95e82fca52275ad22a","observation_id":"9d5e6252-eb2a-4858-b259-dda8df479418","resolution":{"observed_at":"2026-08-07T05:02:20.998341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.837400Z","title":"Gener- alized radiograph representation learning via cross-supervision between images and free-text radiology reports,","venue":null,"work_id":"aa8f4c3e-29ba-4cc5-9a20-a9c143afe8a2","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.002149Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:8d09295e71c7fe4daaea00dc6fc336133c8703a3eea97b20826104fcd1913eed","observation_id":"984b26ad-05cb-41e8-b24a-31d5bad53fe8","resolution":{"observed_at":"2026-08-07T05:02:21.842083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.821073Z","title":"Chexrelnet: An anatomy-aware model for tracking longi- tudinal relationships between chest x-rays,","venue":null,"work_id":"9f030237-57a1-486a-bc46-8fb45cd33ad5","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.006246Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:ef509529902b92f124ee3371ba7296cfaf40b67953c107165ffd3c0a91607f1a","observation_id":"331a124b-a0f9-40ab-be09-e1410669366b","resolution":{"observed_at":"2026-08-07T05:02:21.826179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.804315Z","title":"Chexfusion: Effective fusion of multi-view features using transformers for long-tailed chest x-ray classification,","venue":null,"work_id":"a976714b-4500-4e0c-aae1-649c0ad0760a","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.010139Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:f5530a46a2e03cfb79ecf1ac88db74335a6628abef33ec199e06d22c413e1823","observation_id":"2390c2ce-d423-4c67-9e85-c087b41cd959","resolution":{"observed_at":"2026-08-07T05:02:21.809530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.786815Z","title":"Act like a radiologist: towards reliable multi-view correspondence reasoning for mammogram mass detection,","venue":null,"work_id":"4dc36e7a-afde-4069-a047-644545b89ca2","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.014390Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:0ad32a11f5815db8ffb2c1f1217e73da901ccb334d39ad7fcef0cd7779963b01","observation_id":"9a6e642a-3f72-4cf6-89db-62c0af89edad","resolution":{"observed_at":"2026-08-07T05:02:21.793117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.769156Z","title":"Deltanet: Conditional medical report generation for covid- 19 diagnosis,","venue":null,"work_id":"20dc6e39-c1c5-44b3-9c79-b9f6ee96f11b","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.019327Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:8b796e829331c445e2de039e4bc5b59479d77dff8b2905121ff5f0566ecbdc59","observation_id":"97f3da43-ea3f-477b-a633-d5d0676e25b3","resolution":{"observed_at":"2026-08-07T05:02:21.775166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.023679Z","title":"Self-supervised learning for medical image analysis using image context restoration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.023679Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:316afe89bc8ae1873d2753e24731a7d1ecde7fc2f51e81c0bc06ae339f98c0cd","observation_id":"67f3d0d5-0c5d-4ed6-ab47-b094e5d444cc","resolution":{"observed_at":"2026-08-07T05:02:21.023679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.740730Z","title":"Models genesis,","venue":null,"work_id":"f70121ae-c06d-4897-b2d0-3454d7d763ae","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.027902Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:59ca324b112218dfcb9f4717bc358606f9380943d5eb2e5e746eccec030b081c","observation_id":"9266745b-4665-4de7-9dab-56ec3fdc579f","resolution":{"observed_at":"2026-08-07T05:02:21.745864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.722391Z","title":"Comparing to learn: Surpassing imagenet pretraining on radiographs by comparing image representations,","venue":null,"work_id":"a9a45eb2-c0ea-422a-9ea3-50fe32a971cd","year":2020},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.032152Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:c0ed2dcb398fcbc9a5861f99447c46c0afad308abe94274180ef820b5a439768","observation_id":"64b13a44-3f32-4af8-b3c9-a5ec1d543910","resolution":{"observed_at":"2026-08-07T05:02:21.728548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.035993Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.035993Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:11f5eb396437c3cb8b7dd48addcfc450f4b0da53470388d90f24a827daf50253","observation_id":"092cee43-8f44-407b-85d3-08a0d796bb1e","resolution":{"observed_at":"2026-08-07T05:02:21.035993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.694837Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":"46cc62af-aa18-4768-8946-22efd54e6ac1","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.040046Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:21bf7724545eff8c2bde020bfaaf93b384eb26706243b9ce08ad391147d14ca8","observation_id":"825e5557-90db-47c7-8405-3d29a0b86a88","resolution":{"observed_at":"2026-08-07T05:02:21.700519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.044391Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.044391Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:387e3ffa88170fe6df3664b6bcb85cdc88cdef55332f2761a0b02a3f9eb07590","observation_id":"da009c55-246b-49ff-88d3-e3ca112e52dc","resolution":{"observed_at":"2026-08-07T05:02:21.044391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-07T05:02:21.048709Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.048709Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:58e08b3f518a369677506ca3687f40759cd8c919b4aa5371eca848c4df014a65","observation_id":"31c42f06-88bd-4af9-8adb-30ca8ec081aa","resolution":{"observed_at":"2026-08-07T05:02:21.048709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.666777Z","title":"Knowledge- enhanced visual-language pre-training on chest radiology images,","venue":null,"work_id":"daf07455-8309-404f-a2ae-22b305ce793e","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.052954Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:0680269b9026e9dd29f0d3050f1a83a525e6921330a2b74857e03087dbc11685","observation_id":"6c061e64-054d-4aa8-a068-8b045d806f30","resolution":{"observed_at":"2026-08-07T05:02:21.672655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.056753Z","title":"Carzero: Cross-attention alignment for radiology zero-shot classifica- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.056753Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:48f7538a7c5f117cded9e3f0d7898a9482eca0092aca024665f397b2bc2a3e8a","observation_id":"82213d81-baba-48b2-bfa3-c8891ca4ba0b","resolution":{"observed_at":"2026-08-07T05:02:21.056753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.638722Z","title":"Enhancing representation in radiography- reports foundation model: A granular alignment algorithm using masked contrastive learning,","venue":null,"work_id":"5a1edf50-029a-4679-8d6e-914a60a91343","year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.060464Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:3d2f325fe3f85861362cf9a48a3209a626c9d5886519572a9d37281cf338b09c","observation_id":"f7a18f76-d20c-4853-af0a-549b7b906163","resolution":{"observed_at":"2026-08-07T05:02:21.643981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.064175Z","title":"Medklip: Medical knowledge enhanced language-image pre-training for x-ray diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.064175Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:872c46b72031c463ec5df1c1631fdb5800eb820c90a8cc528b3ac3739ab230f4","observation_id":"cf44f368-257a-4fed-8d31-577fdf9d7fc8","resolution":{"observed_at":"2026-08-07T05:02:21.064175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.068498Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.068498Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:09eb4260edea0bf0ee7c55532d074653ac1b06948f370bcff77980e60ae95a5f","observation_id":"e597b183-f5b7-4d40-becd-542f72198e17","resolution":{"observed_at":"2026-08-07T05:02:21.068498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T05:02:21.072896Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.072896Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:e791e1e847fe0107f4abc7b10ff6bb1dc7e7c60632febc3423b1ca34c088f793","observation_id":"4dd1dd1f-afbf-4c0f-9aed-886cfd4e1571","resolution":{"observed_at":"2026-08-07T05:02:21.072896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.591671Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning,","venue":null,"work_id":"cbffe393-99ca-4e9c-b2eb-54567f77cfc3","year":1950},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.077066Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:48d350522c341b808804bb71851a1a3c20fa31d2b09995eb8bd73f79180377d2","observation_id":"2414083d-5b26-41e4-b267-929771e16a86","resolution":{"observed_at":"2026-08-07T05:02:21.600504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.578041Z","title":"Bitfit: Simple parameter- efficient fine-tuning for transformer-based masked language-models,","venue":null,"work_id":"a8da5392-f677-468e-8044-dfa02bd78315","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.081187Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:61b732e98f355896473481575635bcd6a6a00ae42fcf90b426dc5493979872a9","observation_id":"adf02300-4504-4571-be33-5c3b7c460cf1","resolution":{"observed_at":"2026-08-07T05:02:21.582459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-08T06:15:11.222260Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-07T05:02:21.085120Z","title":"Towards a unified view of parameter-efficient transfer learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.085120Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:30681d63812cccd7f1f7cfb84937510ae651e05e9fb0aec818cb98f70d4df1d4","observation_id":"582f3bc9-43a9-4b30-80ad-3c3bb71c53fa","resolution":{"observed_at":"2026-08-07T05:02:21.085120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.089229Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.089229Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:26dd6a134591b96077cd055acdbeed5c631f99a4680f092577aab0245db6f581","observation_id":"6d08116e-f5cd-4dc2-9991-c6c6cbcf7a3d","resolution":{"observed_at":"2026-08-07T05:02:21.089229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.552925Z","title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks,","venue":null,"work_id":"11c2a5e7-8d92-4d0e-a0c2-37971a08f9f6","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.093214Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:06dae4727c410448f324bbb821d7699eed9db20cc37d985ed81f13dc9db6b301","observation_id":"9cb90014-3299-4f7d-bbe1-e5906504b314","resolution":{"observed_at":"2026-08-07T05:02:21.557861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03024","last_updated":"2023-02-06T18:59:17Z","snapshot_observed_at":"2026-08-03T18:56:56.378342Z","submitted_at":"2023-02-06T18:59:17Z","title":"AIM: Adapting Image Models for Efficient Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03024","snapshot_observed_at":"2026-08-07T05:02:21.096816Z","title":"Aim: Adapting image models for efficient video action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.096816Z"},"links":{"cited_paper":"/paper/2302.03024","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:b96d1f1b87e2613ea7885357ce4899e39951fd3e90ee2d6799b7c9b45e1b6cbe","observation_id":"cd240235-3b9b-41ee-b783-60e85f662059","resolution":{"observed_at":"2026-08-07T05:02:21.096816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.08534","last_updated":"2023-02-13T15:50:22Z","snapshot_observed_at":"2026-08-07T21:44:39.930046Z","submitted_at":"2022-05-17T17:59:11Z","title":"Vision Transformer Adapter for Dense Predictions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.08534","snapshot_observed_at":"2026-08-07T05:02:21.100923Z","title":"Vision transformer adapter for dense predictions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.100923Z"},"links":{"cited_paper":"/paper/2205.08534","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:2f5e22d88ae9aff17f372645b92d4a6f7cd031ce377879de208d7989def391dc","observation_id":"b1b5eee8-d624-4a21-8933-82b1f20b639e","resolution":{"observed_at":"2026-08-07T05:02:21.100923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08252","last_updated":"2024-06-10T15:11:40Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-14T21:18:18Z","title":"Parameter-Efficient Fine-Tuning for Medical Image Analysis: The Missed Opportunity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08252","snapshot_observed_at":"2026-08-07T05:02:21.105209Z","title":"Parameter-efficient fine-tuning for medical image analysis: The missed opportunity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.105209Z"},"links":{"cited_paper":"/paper/2305.08252","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:c7d3fb1af29b302a4d7d8928b32f74f26987b88a2df17e0d7d9591a2a0f8a546","observation_id":"f0189b50-bdb5-4c9c-b43f-64fff44af3f5","resolution":{"observed_at":"2026-08-07T05:02:21.105209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08236","last_updated":"2024-07-22T05:39:53Z","snapshot_observed_at":"2026-07-06T16:47:24.765597Z","submitted_at":"2023-11-14T15:18:54Z","title":"MeLo: Low-rank Adaptation is Better than Fine-tuning for Medical Image Diagnosis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08236","snapshot_observed_at":"2026-08-07T05:02:21.109848Z","title":"Melo: Low-rank adaptation is better than fine-tuning for medical image diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.109848Z"},"links":{"cited_paper":"/paper/2311.08236","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:fbe58e179576ca8e0753a6e74ecb25ba6062ec4afcdb0079df808e3331c32cfa","observation_id":"3cf57145-50b6-4376-b42d-feb2aa78d11f","resolution":{"observed_at":"2026-08-07T05:02:21.109848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12215","last_updated":"2024-01-22T18:59:07Z","snapshot_observed_at":"2026-07-06T17:18:56.465394Z","submitted_at":"2024-01-22T18:59:07Z","title":"Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12215","snapshot_observed_at":"2026-08-07T05:02:21.115036Z","title":"Less could be better: Parameter-efficient fine-tuning advances medical vision foundation mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.115036Z"},"links":{"cited_paper":"/paper/2401.12215","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:ee90388504b1f868ed9b37b0f494e3ab9932a3a34275c830bf50782f3584a2fc","observation_id":"940aa1de-6d6a-46ff-a5c0-aaa6968df2bc","resolution":{"observed_at":"2026-08-07T05:02:21.115036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.536622Z","title":"Prompt tuning for parameter- efficient medical image segmentation,","venue":null,"work_id":"a91e29c0-8173-40a2-aaea-ba96f7b5d026","year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.119838Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:d866ae514724119b2845e54f9fb5d5ac36bf2f4270e9a87022070374953c8b90","observation_id":"9c12a0b7-ad35-4518-b3c9-b359c796cb09","resolution":{"observed_at":"2026-08-07T05:02:21.542188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.519961Z","title":"Towards foundation models and few-shot parameter-efficient fine-tuning for volumetric organ seg- mentation,","venue":null,"work_id":"8be5a153-bab5-4f53-add8-4f551c36773c","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.123971Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:027d69cb5d3ca275501d198920bc400c0e8648c57e095823b4c3435ad0f6e0f3","observation_id":"12073882-8e25-47fa-b8f3-13c49385940a","resolution":{"observed_at":"2026-08-07T05:02:21.525535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11866","last_updated":"2023-03-21T14:12:08Z","snapshot_observed_at":"2026-07-06T15:06:11.896701Z","submitted_at":"2023-03-21T14:12:08Z","title":"Contrastive Alignment of Vision to Language Through Parameter-Efficient Transfer Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11866","snapshot_observed_at":"2026-08-07T05:02:21.128128Z","title":"Contrastive alignment of vision to language through parameter-efficient transfer learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.128128Z"},"links":{"cited_paper":"/paper/2303.11866","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:9c2e6f3a1d649476aa8ba954d1ef306472f6063855558f48b60bade65dad5196","observation_id":"fd6089af-958e-43a2-98df-a43146bd29da","resolution":{"observed_at":"2026-08-07T05:02:21.128128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.504899Z","title":"Scaling language- image pre-training via masking,","venue":null,"work_id":"f090ec33-254a-454f-8796-15fd660f585c","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.132633Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:91a96d19414fe8fb27051479304ef1ef1df22e6c256dfb63589c03596082696d","observation_id":"dfda98a6-9006-4d5c-a902-26e0b1555765","resolution":{"observed_at":"2026-08-07T05:02:21.509160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.136469Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.136469Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:6b9deb296ab7efe50c6f1bfa5c1f4842c1f2c9f9592828ed576086e7698a57e6","observation_id":"677245e6-b7da-4913-b2a4-b271c50526f2","resolution":{"observed_at":"2026-08-07T05:02:21.136469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T05:02:21.140339Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.140339Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:acf76fa9bcc241d5ce1213d44980a62c0218275832a40cc168f974164a737942","observation_id":"e36c3afa-c4bb-4bf9-af8b-6324a2c96d89","resolution":{"observed_at":"2026-08-07T05:02:21.140339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.481078Z","title":"Mvco- dot: Multi-view contrastive domain transfer network for medical report generation,","venue":null,"work_id":"9da5e026-e93e-46e7-ba36-cbfba48a5230","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.144569Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:102ecd92c7bdf5e1b214dc1fbbc827046ac27cc518c939c7e94e12d52b2094f1","observation_id":"56ec48d9-6ab1-429d-8320-7828089505f6","resolution":{"observed_at":"2026-08-07T05:02:21.485757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T05:02:21.149064Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.149064Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:7dc60262f07ceff08909d509ca4e2918367d4a3fdeeb40e34b90ba0f6584e3b7","observation_id":"88e534ca-45b7-4aef-b061-c2390706973e","resolution":{"observed_at":"2026-08-07T05:02:21.149064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.463738Z","title":"Augmenting the national institutes of health chest radiograph dataset with expert annotations of possible pneumonia,","venue":null,"work_id":"2bbffb90-3378-41b4-a35b-a2d6296bdd6c","year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.153308Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:43205eb60d89fdf82e28162f5552b692dfc45c89666659731f7176fd1d370186","observation_id":"ed74d849-4d17-493c-90d0-3a5ca81c09aa","resolution":{"observed_at":"2026-08-07T05:02:21.470237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10042","last_updated":"2021-04-12T20:41:48Z","snapshot_observed_at":"2026-08-03T14:57:07.650557Z","submitted_at":"2020-10-20T05:42:47Z","title":"Improving Factual Completeness and Consistency of Image-to-Text Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.10042","snapshot_observed_at":"2026-08-07T05:02:21.157303Z","title":"Im- proving factual completeness and consistency of image-to-text radiology report generation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.157303Z"},"links":{"cited_paper":"/paper/2010.10042","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:a0f0ed3d64fc99179a5421a98b073e10beacc9c26f17b71c95539cb4fe7e1e57","observation_id":"c3d7a77f-16a5-4936-be96-df9a5d821719","resolution":{"observed_at":"2026-08-07T05:02:21.157303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.161272Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.161272Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:59e7a36145e7b4c9eb18a7cd9c0f444d950247b1aefd216fd2ffe0a9fd6a9a29","observation_id":"01006229-228d-4ad5-9916-e3da28397fdb","resolution":{"observed_at":"2026-08-07T05:02:21.161272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T05:02:21.165503Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.165503Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:a4d51659445d1af6fb7163020293b74a48d421e4d56c389a93cef94b0e9bdb84","observation_id":"75493d61-a82c-408a-8cd7-dfe7fe39055b","resolution":{"observed_at":"2026-08-07T05:02:21.165503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:46:24.536673Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2506.08990."}