{"as_of":"2026-08-09T03:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d0b165ca53b6e541f3ce72b1f01dd57c5212f3e63360537a7c654a172dd9650","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:26:28.903390Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:08:02.505489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:47:40.979179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"cited_work":{"arxiv_id":"2502.05928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05928","snapshot_observed_at":"2026-07-03T05:47:40.979179Z","title":null,"venue":null,"work_id":"ee0abaef-92e9-4654-ad89-465e2831c73f","year":2025},"citing_paper":{"arxiv_id":"2606.11106","last_updated":"2026-06-09T17:03:37Z","snapshot_observed_at":"2026-08-07T20:29:53.261527Z","submitted_at":"2026-06-09T17:03:37Z","title":"FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T13:08:02.505489Z"},"links":{"cited_paper":"/paper/2502.05928","citing_paper":"/paper/2606.11106"},"observation_digest":"sha256:7a8da344bb478ccde758542d2e710c1c138dba6183033a9cbba1185e3c37c226","observation_id":"2ac4f0d3-c1ee-45d7-8d69-6eadbac8efd2","resolution":{"observed_at":"2026-07-03T05:47:40.980557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05928/citation-record","integrity":"/paper/2502.05928/integrity","json":"/paper/2502.05928/citation-record.json","paper":"/paper/2502.05928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.824856Z","title":"Hasan, Vivek Datla, Joey Liu, Dina Demner-Fushman, and Henning Müller","venue":null,"work_id":"aa7cb026-5008-4f02-89db-1317837dc371","year":2019},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.724936Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:505736d1699ed07d9f46bf61b0a029e117e278c66136b05de3538ea942e81ea6","observation_id":"e94c8803-b6cf-4fd2-9228-7b62e17d2d6e","resolution":{"observed_at":"2026-08-08T17:26:29.828526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.814818Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"cf1cb2f1-79da-475d-8253-ccbaadb0cd43","year":2016},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.728940Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:567ecda9caf1a76d0816a1cf92c727e18880ac5112f7b06c5ff1f13cf58d274d","observation_id":"fa800f7b-5c6f-4c94-b913-93a123ec5cae","resolution":{"observed_at":"2026-08-08T17:26:29.818384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-08T17:26:28.732983Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.732983Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:821f3752e920981486fea1ee654458976438578a08b6a51908b8e1bb5d890bb2","observation_id":"540e8e91-458f-4f1e-91e6-d3103796147a","resolution":{"observed_at":"2026-08-08T17:26:28.732983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.803426Z","title":"The revolution of multimodal large language models: A survey","venue":null,"work_id":"ac3d8dff-9f08-4a20-a6dc-6a50793b9409","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.737058Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:ca47d200c1a8bd1b93033e3e8ac0f1af9100e44fea5839075c7f5eb1d2790ed9","observation_id":"1e2dd7d5-2972-44cf-9b51-239aa2f9f2ac","resolution":{"observed_at":"2026-08-08T17:26:29.807623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20327","last_updated":"2025-03-09T05:23:35Z","snapshot_observed_at":"2026-08-04T23:55:18.555432Z","submitted_at":"2024-10-27T03:56:56Z","title":"R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20327","snapshot_observed_at":"2026-08-08T17:26:28.740621Z","title":"R-llava: Improving med-vqa understanding through visual region of interest.arXiv preprint arXiv:2410.20327, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.740621Z"},"links":{"cited_paper":"/paper/2410.20327","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:c7aaf8df3a52d5ba3621a0a8982a484858d38fe2d863dd15d9281a0958a268b6","observation_id":"c5800137-91d9-42a9-98e2-38c9fa5183e6","resolution":{"observed_at":"2026-08-08T17:26:28.740621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07006","last_updated":"2023-12-12T06:35:27Z","snapshot_observed_at":"2026-08-07T02:35:14.742400Z","submitted_at":"2023-12-12T06:35:27Z","title":"Mixed Pseudo Labels for Semi-Supervised Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07006","snapshot_observed_at":"2026-08-08T17:26:28.744479Z","title":"Mixed pseudo labels for semi-supervised object detection.arXiv preprint arXiv:2312.07006, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.744479Z"},"links":{"cited_paper":"/paper/2312.07006","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:7102ca10a89fcaa00741e033f2ade8d436d5a1daee08f2c1dbae8f261a8d3b4f","observation_id":"e3cbf274-c92d-4935-bcc2-06816c407c19","resolution":{"observed_at":"2026-08-08T17:26:28.744479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16184","last_updated":"2023-08-30T17:59:02Z","snapshot_observed_at":"2026-07-06T16:12:26.218372Z","submitted_at":"2023-08-30T17:59:02Z","title":"SAM-Med2D","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16184","snapshot_observed_at":"2026-08-08T17:26:28.748689Z","title":"Sam-med2d.arXiv preprint arXiv:2308.16184, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.748689Z"},"links":{"cited_paper":"/paper/2308.16184","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:2c2667025417d85c4cf0e2b01c2a606bb5e57db89bc2d600e16afb3412a123e9","observation_id":"5ae6695e-eac8-43b9-9496-ea7ad6022937","resolution":{"observed_at":"2026-08-08T17:26:28.748689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.791777Z","title":null,"venue":null,"work_id":"59423c99-a873-4111-a7ab-761ed013fc14","year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.752414Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:50bfaf8f4aba4439b611e73c47de1554ec9635b785fa215a5c7db0ffb4b57e4b","observation_id":"1ca61755-d128-45b1-8520-0ecce10fa243","resolution":{"observed_at":"2026-08-08T17:26:29.795526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.780815Z","title":"Enhancing medical VQA with multimodal determination rationales","venue":null,"work_id":"3c58de5e-4673-493c-8b3f-e4bce0cc3202","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.755932Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:e94b7e0f995bd0bb579a28ae03b83e76628392e541d832dc3f11dfaf73dbeea4","observation_id":"0acab50f-b9fe-49bc-84cd-98e8c32a5ce6","resolution":{"observed_at":"2026-08-08T17:26:29.784785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.770679Z","title":"Hasan, Yuan Ling, Oladimeji Farri, Joey Liu, Henning Müller, and Matthew P","venue":null,"work_id":"f1fff901-22ed-46fb-b629-bfbe94b50297","year":2018},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.759219Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:b1a9ac02d322e79d56d5954c880d0d6b8d894bfc3091c9f8c5dc5548b2bbc7ee","observation_id":"34f346a7-b109-45c5-9f8f-861d1200639a","resolution":{"observed_at":"2026-08-08T17:26:29.774228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23822","last_updated":"2024-10-31T11:07:26Z","snapshot_observed_at":"2026-07-06T19:42:47.238254Z","submitted_at":"2024-10-31T11:07:26Z","title":"Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23822","snapshot_observed_at":"2026-08-08T17:26:28.762817Z","title":"Parameter-efficient fine-tuning medical multimodal large language models for medical visual grounding.arXiv preprint arXiv:2410.23822, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.762817Z"},"links":{"cited_paper":"/paper/2410.23822","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:6f73c5a2fc09234d526ffc93962da2267273b609afc76f2c4ae673df3d8bbb2d","observation_id":"d4c6f41c-3374-47b6-8195-7c141732ab98","resolution":{"observed_at":"2026-08-08T17:26:28.762817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-08T17:26:28.766461Z","title":"Pathvqa: 30000+ questions for medical visual question answering.arXiv preprint arXiv:2003.10286, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.766461Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:c8641558bd4c336298644ef778a638dd772c1570addb6b568ee57f502f988616","observation_id":"69d37335-c96d-4ef6-98c4-bffdab392d90","resolution":{"observed_at":"2026-08-08T17:26:28.766461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.760477Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":"20950c03-8dde-4038-8ee7-44504d5966dc","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.770156Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:0e8517eb05e6a46e11684f63bbadf60eb5e3d745e7a8d69881c37137f9a7f68c","observation_id":"db98cd9f-dd53-43a8-a682-9030fbe7127b","resolution":{"observed_at":"2026-08-08T17:26:29.764002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T17:26:28.773566Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.773566Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:bab786f1e93b3ee3d7ae49428f9f0f38c785e830d2997102b0101b305822605a","observation_id":"23533ab1-26e9-4a57-8ea7-518607cc5574","resolution":{"observed_at":"2026-08-08T17:26:28.773566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.750312Z","title":"A refer-and-ground multimodal large language model for biomedicine","venue":null,"work_id":"a6dfed3a-5617-4874-92e0-7bfd82f191aa","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.777238Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:b151cf7620393112a845e8c89112de333766a4c16884aeb2e027556ec3a2ed01","observation_id":"b158e2a1-d394-46b1-a099-d0a7429cd01c","resolution":{"observed_at":"2026-08-08T17:26:29.754097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02458","last_updated":"2025-08-19T03:21:25Z","snapshot_observed_at":"2026-07-06T19:26:58.835479Z","submitted_at":"2024-10-03T14:50:33Z","title":"MedVisionLlama: Leveraging Pre-Trained Large Language Model Layers to Enhance Medical Image Segmentation","version":3},"cited_work":{"arxiv_id":"2410.02458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02458","snapshot_observed_at":"2026-08-08T17:26:29.463966Z","title":"MedVisionLlama: Leveraging Pre-Trained Large Language Model Layers to Enhance Medical Image Segmentation","venue":"eess.IV","work_id":"441c239a-cc2d-431d-a267-4d593ea7d389","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.784274Z"},"links":{"cited_paper":"/paper/2410.02458","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:d2cf366873caa8baa7e3cbf1c96ddd4853d461220830fefe3edb724f62746945","observation_id":"841e7257-7abe-48ce-9a2f-b7a8475f97ab","resolution":{"observed_at":"2026-08-08T17:26:29.468034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.788101Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.788101Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:73e12dfa1da7e70aa6a9b864fb5b2f8caf17d7bb9ab775d41389aa15f5b4bfb3","observation_id":"32585bb0-b0cc-45e0-bbdc-a68845552b5f","resolution":{"observed_at":"2026-08-08T17:26:28.788101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08172","last_updated":"2023-11-25T07:59:48Z","snapshot_observed_at":"2026-08-07T21:43:09.892404Z","submitted_at":"2023-11-14T14:02:32Z","title":"Vision-Language Instruction Tuning: A Review and Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08172","snapshot_observed_at":"2026-08-08T17:26:28.791677Z","title":"Vision-language instruction tuning: A review and analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.791677Z"},"links":{"cited_paper":"/paper/2311.08172","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:7cd9670e98f8743a65a293c9f2b4486da1f5900c806cd7ec8d7dccc93ca676cd","observation_id":"7971a455-4b7a-454b-8ed3-10a139425ea5","resolution":{"observed_at":"2026-08-08T17:26:28.791677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.795486Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36:28541–28564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.795486Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:bda52ff8653371c44506293990211cc31bd965d4c7f2f106642024c0d249f1ab","observation_id":"c0c6ff4c-f141-424e-814d-60fd02252925","resolution":{"observed_at":"2026-08-08T17:26:28.795486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.720711Z","title":"Towards visual-prompt temporal answer grounding in instructional video.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"4440b6ca-84a1-4296-953a-28e04f8a5494","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.798995Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:69362d0708e00f64ec6e1a58d8f0c7dad0e6de9924d62498c38b0b949a8d8983","observation_id":"13f61901-5b5e-486c-92ba-5df82e69fbd1","resolution":{"observed_at":"2026-08-08T17:26:29.724444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.709955Z","title":"Pseudo labels for unsupervised domain adaptation: A review","venue":null,"work_id":"0afc3f69-8dbb-4afb-abaa-a6e0f62e9ead","year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.802171Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:0941b0129059d500b66963bd91673a0ab18720e19046471a2d272c35b3dd0604","observation_id":"33438188-404f-4b70-9b29-08705daa8ddf","resolution":{"observed_at":"2026-08-08T17:26:29.713921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.805527Z","title":"A comprehensive survey and guide to multimodal large language models in vision-language tasks.arXiv preprint arXiv:2411.06284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.805527Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:c8f309a15c4cb27d3bf74301a9164337adc03f03ab64c010dd2626fc0848f451","observation_id":"695be0d4-5b54-4b5f-9a06-ecfb3bfe3028","resolution":{"observed_at":"2026-08-08T17:26:28.805527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.698425Z","title":"Medfilip: Medical fine-grained language-image pre-training.IEEE Journal of Biomedical and Health Informatics, pages 1–11, 2025","venue":null,"work_id":"7479fad4-0a5a-4f85-83c0-6e760652c914","year":2025},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.808811Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:d87d6c880b2b3f3513f88840e9098bbf36f8ddfae1e53772df0a86b40c47c0e8","observation_id":"48c9db19-c440-426d-ac51-59cfa09cbf05","resolution":{"observed_at":"2026-08-08T17:26:29.702840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09838","last_updated":"2025-02-21T17:39:29Z","snapshot_observed_at":"2026-08-08T11:58:23.364847Z","submitted_at":"2025-02-14T00:42:36Z","title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09838","snapshot_observed_at":"2026-08-08T17:26:28.812115Z","title":"Healthgpt: A medical large vision-language model for unifying com- prehension and generation via heterogeneous knowledge adaptation.arXiv preprint arXiv:2502.09838, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.812115Z"},"links":{"cited_paper":"/paper/2502.09838","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:ecd27b91766fdf651e72ed7f3692101edc3102359aca6179e95d5c09a427c9cd","observation_id":"56aafb93-0a05-4117-aa2b-b8717cd5045b","resolution":{"observed_at":"2026-08-08T17:26:28.812115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.686851Z","title":"Lawrence Zitnick","venue":null,"work_id":"698e7bf0-70f5-4a09-8c9a-8016932cb4f6","year":2014},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.815732Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:1ff4889088ce3bad77c49ee87a64e5200920d8a9e8d2fb039b79fd6756b98134","observation_id":"b2c74f02-0fc8-47de-861a-15489c8ad1fd","resolution":{"observed_at":"2026-08-08T17:26:29.690906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.675383Z","title":"Medical visual question answering: A survey.Artificial Intelligence in Medicine, 143:102611, September 2023","venue":null,"work_id":"73d348ff-a578-459a-a7f1-461a0e8f8c3e","year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.819189Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:e987660098fc44fcd24eae33c05e8e2e5388003d4102b1e4fab942334a082fdc","observation_id":"031bcc8b-2902-4d29-8b1b-e62b516a752e","resolution":{"observed_at":"2026-08-08T17:26:29.679656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.822637Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.822637Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:966b7525eb431c0eb9c43e1ca01276ccb6f5ac2b57e129e89b44a8110f97c69b","observation_id":"239d602e-9789-4b5e-a6a6-8a165b986033","resolution":{"observed_at":"2026-08-08T17:26:28.822637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.825851Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.825851Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:2a4f4f0d5fe3f659f2db22c460d4e2921aeeed0ef36a374d567e5fe9d7538427","observation_id":"55c9dc88-8717-4f83-8263-97d5b6ce4808","resolution":{"observed_at":"2026-08-08T17:26:28.825851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.829253Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.829253Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:2dc513c0196cfc5b672c8274faaa97f30e8e265349c42749a3aa0831e817c28a","observation_id":"a10a4ee1-0311-4bfc-89cb-233eb6a60227","resolution":{"observed_at":"2026-08-08T17:26:28.829253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11070","last_updated":"2024-12-15T06:04:16Z","snapshot_observed_at":"2026-07-06T20:07:14.913902Z","submitted_at":"2024-12-15T06:04:16Z","title":"HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation","version":1},"cited_work":{"arxiv_id":"2412.11070","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11070","snapshot_observed_at":"2026-08-08T17:26:29.183508Z","title":"HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation","venue":"cs.CV","work_id":"d96c877a-b418-45c9-b12e-2b6996af8cff","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.832678Z"},"links":{"cited_paper":"/paper/2412.11070","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:f9e35179329832349c33181a5ca3c21d1e13c06ab3a7a13f2ef46a1b3e98cf22","observation_id":"160477dd-c428-4f93-b800-d8fef28e03f6","resolution":{"observed_at":"2026-08-08T17:26:29.189728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.645435Z","title":"Vkd: Improving knowledge distillation using orthogonal projections","venue":null,"work_id":"eba43e28-d0c1-4b83-b4c9-f8bf769e057e","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.836028Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:af211adcbdb32c6aa8cb0dfce4b3698ba3ae9103de221c0a8f74d9d2f153caa3","observation_id":"a983ef33-30cc-4b66-8310-7c0560b3da1c","resolution":{"observed_at":"2026-08-08T17:26:29.649505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.839204Z","title":"Med-flamingo: a multimodal medical few-shot learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.839204Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:c79f8dae18c534f660529ff9ecc722721d98ad8f43ff85fa7405809a085bafc1","observation_id":"cb4d674a-f012-4b0e-a89a-f91dffee36f4","resolution":{"observed_at":"2026-08-08T17:26:28.839204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.627108Z","title":"Learning deep representations with probabilistic knowledge transfer","venue":null,"work_id":"2ceda794-1686-44ad-873a-d7e71a99f1c4","year":2018},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.842573Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:0d93366f45f9778c217fa00a683542b5ed3d3ec4f23ad29872a5ec28aaedf5d9","observation_id":"37f7ff8b-45b8-4db2-907e-ad3c8bfead33","resolution":{"observed_at":"2026-08-08T17:26:29.631339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.846187Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.846187Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:7ac91399a80a11d769520d09894d650e31f11dbc5c61e9cebfd5bbe043ccd9be","observation_id":"d278ba54-4f14-45bc-8044-f97fde37b150","resolution":{"observed_at":"2026-08-08T17:26:28.846187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.609145Z","title":"Similarity-preserving knowledge distillation","venue":null,"work_id":"f00615eb-f019-48b3-86e8-2eeb49c2d92f","year":2019},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.849454Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:49120049009e63698d0e62b145bfe01b7fdb0b0266ae7393b80cc2e423fe738c","observation_id":"cf8f52fb-56cd-4f2a-9d0e-f3305d27f596","resolution":{"observed_at":"2026-08-08T17:26:29.612914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T17:26:28.852580Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.852580Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:02615fe47e1d92fafedb42137caa85bca307f93c19e06eca4c063f067cface16","observation_id":"5623161c-9ea5-4de5-8e2c-877dd240504b","resolution":{"observed_at":"2026-08-08T17:26:28.852580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.598351Z","title":"ITA: Image-text alignments for multi-modal named entity recognition","venue":null,"work_id":"1fca4571-81ae-4551-801f-f3374db24ff6","year":2022},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.856024Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:1b2c0551b235da377dbdbba166a677e96d3c68e5333e434e8622dc3f26fe3928","observation_id":"04d82afc-160b-4efb-a9fd-25be3bb7c2ad","resolution":{"observed_at":"2026-08-08T17:26:29.602771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-08T19:58:39.444110Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-08T17:26:28.859252Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.859252Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:aa465401c3662bf117a3c7fdbebff8f3f5b5083cde038f50a347f8d6c35b4c14","observation_id":"0c8f2209-5d3c-42fd-ab0c-1e4749873c54","resolution":{"observed_at":"2026-08-08T17:26:28.859252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-08T17:26:28.862700Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities.arXiv preprint arXiv:2408.07666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.862700Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:983d8acfd37df0a2abb275d1f068b5775261bfaaafd037259c386ecbb0405881","observation_id":"0c3aebb5-9e25-4515-a346-e664a6db041b","resolution":{"observed_at":"2026-08-08T17:26:28.862700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05464","last_updated":"2025-01-18T05:53:51Z","snapshot_observed_at":"2026-07-06T20:18:53.977126Z","submitted_at":"2024-12-31T19:55:45Z","title":"LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05464","snapshot_observed_at":"2026-08-08T17:26:28.866002Z","title":"Llm-medqa: Enhancing medical question answering through case studies in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.866002Z"},"links":{"cited_paper":"/paper/2501.05464","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:d9420aede7854ec511554d0e3fdfa2f8a43717f9ba2dd1374715b5b5ba240426","observation_id":"10bb5225-3e6f-45bf-ad53-76867a54c702","resolution":{"observed_at":"2026-08-08T17:26:28.866002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11969","last_updated":"2023-11-20T17:59:03Z","snapshot_observed_at":"2026-08-07T05:38:29.801244Z","submitted_at":"2023-11-20T17:59:03Z","title":"SA-Med2D-20M Dataset: Segment Anything in 2D Medical Imaging with 20 Million masks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11969","snapshot_observed_at":"2026-08-08T17:26:28.869297Z","title":"Sa-med2d-20m dataset: Segment anything in 2d medical imaging with 20 million masks.arXiv preprint arXiv:2311.11969, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.869297Z"},"links":{"cited_paper":"/paper/2311.11969","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:1e1fefae1c305dc77966b45280d1e5adec46473fb9f54244e8bf42b4116b0ccd","observation_id":"4df41cd2-d9da-4d39-9485-c4850eebf467","resolution":{"observed_at":"2026-08-08T17:26:28.869297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-08T17:26:28.873088Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.873088Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:c56c9ef0b6c01f70b12ac8e4c46f1ace9363e43e46149ac8de262c08c288ea85","observation_id":"607dcf93-e167-40e9-96a6-8bbbf35ff8da","resolution":{"observed_at":"2026-08-08T17:26:28.873088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12790","last_updated":"2024-11-19T14:49:36Z","snapshot_observed_at":"2026-07-06T19:52:46.580689Z","submitted_at":"2024-11-19T14:49:36Z","title":"Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12790","snapshot_observed_at":"2026-08-08T17:26:28.876560Z","title":"Visual-oriented fine-grained knowledge editing for multimodal large language models.arXiv preprint arXiv:2411.12790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.876560Z"},"links":{"cited_paper":"/paper/2411.12790","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:7384fc432aaa0dd464f96a11ee935c0cd60036b6a10dfa0cca3e191a6dd07212","observation_id":"95457c9d-4a1a-4666-b1d1-2adb74e27b9f","resolution":{"observed_at":"2026-08-08T17:26:28.876560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-08T17:26:28.879917Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models.arXiv preprint arXiv:2404.07973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.879917Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:fb38b7552d7607129f2270e1b785fb0a0f827e93dbf84de62409fe15f673626f","observation_id":"30ff817f-1f3f-4dfc-b3db-e497b9323d08","resolution":{"observed_at":"2026-08-08T17:26:28.879917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.587432Z","title":"Davison, Hui Ren, Jing Huang, Chen Chen, Yuyin Zhou, Sunyang Fu, Wei Liu, Tianming Liu, Xiang Li, Yong Chen, Lifang He, James Zou, Quanzheng Li, Hongfang Liu, and Lichao Sun","venue":null,"work_id":"67fe3ebb-1db5-4256-9a31-2a50146d5cba","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.883459Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:ade346a34725dd1ac57d30516d264944006ad0ae18475047996b742b6ac9daee","observation_id":"88d15807-218e-4def-bd5c-c2f9e0a3a0b3","resolution":{"observed_at":"2026-08-08T17:26:29.591556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.576254Z","title":"Negative-aware attention framework for image-text matching","venue":null,"work_id":"f0edc139-89de-4e77-8d15-ebe35d8cfe9e","year":2022},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.886762Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:5355d51924a93931ee6eb39be58132b2d0fe7a92e6d2bc69de3b0c18eef583a4","observation_id":"5d9ad6d2-4394-4689-aa94-8848b23c618c","resolution":{"observed_at":"2026-08-08T17:26:29.579997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-08T17:26:28.889887Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.arXiv preprint arXiv:2303.00915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.889887Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:2040eb0ae8f77f0b0e9b91406f42eb4980d44dd17131e297991790e7664abcb2","observation_id":"2484f6b7-4569-4f55-bfed-cb73f174fa36","resolution":{"observed_at":"2026-08-08T17:26:28.889887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.893406Z","title":"Instruction tuning for large language models: A survey.arXiv preprint arXiv:2308.10792, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.893406Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:21bca7ef46e75c2f1f36d5f577d13a26e52d41aa2a298d05ce4459a7e38fc93e","observation_id":"46d5a016-04ec-457d-bfbc-899176af1080","resolution":{"observed_at":"2026-08-08T17:26:28.893406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.564625Z","title":"Consecutive knowledge meta-adaptation learning for unsupervised medical diagnosis.Knowledge-Based Systems, 291:111573, 2024","venue":null,"work_id":"9beb017f-2e81-4c94-8bb2-ee245b76d5f0","year":2024},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.896634Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:7220f28bdf132f331390e1131ca48220ecc870db87d6287a5e828dd1373c6475","observation_id":"56cda649-f7b4-4bce-8130-274aebc7143d","resolution":{"observed_at":"2026-08-08T17:26:29.568438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.899998Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.899998Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:e253effd4c0ad8ffd65fd6fe51896fa5810ce5b206ec52e74115f60381345bfe","observation_id":"84a7b064-aa80-47ab-bb7a-e8eba4e1d54d","resolution":{"observed_at":"2026-08-08T17:26:28.899998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:29.548306Z","title":"Semantic understanding of scenes through the ade20k dataset.International Journal of Computer Vision, 127:302–321, 2019","venue":null,"work_id":"add9c983-6a40-484c-bf44-360ea3c0b401","year":2019},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.903390Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:17ce733805751cc26b250606670159abe86183d9c0b7746b63275750c5573cb5","observation_id":"48afdfad-3585-4f92-8ba8-faa735393b9a","resolution":{"observed_at":"2026-08-08T17:26:29.552018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:26:28.780612Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.780612Z"},"links":{"citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:90d55569edd011bf44269d18b79f7ce83073ef4890ef707d0738cbfea209cf82","observation_id":"941e323c-6c5a-4ede-b595-6a6d7a3907c5","resolution":{"observed_at":"2026-08-08T17:26:28.780612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T17:18:53.126749Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2502.05928."}