{"as_of":"2026-08-18T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac798c15baad463cd220fe20455740dd32ae666af6a7b2eb53f50cc1506ccaa4","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:19:54.253838Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.15929/citation-record","integrity":"/paper/2504.15929/integrity","json":"/paper/2504.15929/citation-record.json","paper":"/paper/2504.15929"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.965152Z","title":"Robust stochastic neural ensemble learning with noisy labels for thoracic disease classification","venue":null,"work_id":"7491a971-8577-4d26-a4af-822844b6d25b","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.980929Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:13b472339f82d1f3932bcfddf24f211d2476951cd88c429684f92a3119fcd999","observation_id":"95ae434c-33db-47d3-a027-9dab2258c2cd","resolution":{"observed_at":"2026-08-16T11:19:54.967965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.958012Z","title":"Dawidowicz, E","venue":null,"work_id":"7f7b776f-2489-4128-9b85-0b1c41e87816","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.984593Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:798d159636bab673713ce71eb74188d470b16cbffd59cd8deb0d509f8759d026","observation_id":"0b9b2160-30e3-4c44-8b4d-c4c1deeef0d8","resolution":{"observed_at":"2026-08-16T11:19:54.961171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.948812Z","title":"Dynamic graph enhanced contrastive learning for chest x-ray report generation","venue":null,"work_id":"e9b39769-5518-4851-90a4-be8c4989b26c","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.988678Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:26e03838d7bd9f61af7a599cbe0dc53dbec5a8899a4809a627509db6b4ef6eee","observation_id":"0a05d9fc-cc50-424b-85b4-1b24c26ca417","resolution":{"observed_at":"2026-08-16T11:19:54.952105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.939183Z","title":"Miter: Medical image–text joint adaptive pretraining with multi-level contrastive learning","venue":null,"work_id":"7ba1b83f-189e-47fb-80d2-54d262115e46","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.991664Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:87dd22b4a8ef57f77ec0ff62f798f053343140cbb4cadad928c21f73d05e9b98","observation_id":"4ecb78ce-541e-417c-9693-bb0bfe92ee29","resolution":{"observed_at":"2026-08-16T11:19:54.942678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.932461Z","title":"Vision-language models for radiology AI","venue":null,"work_id":"eb872c8d-790f-4502-a439-d90688c89f9e","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.994643Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:a767b635049b332f52411798700c7f97c7635760c56e3b215f96d839b9b0a9b8","observation_id":"352daccd-d6ff-4bc2-bee3-f6b492ebf0d7","resolution":{"observed_at":"2026-08-16T11:19:54.934783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.925752Z","title":"Automated radiographic report generation purely on transformer: A multicriteria supervised approach","venue":null,"work_id":"8b26f1f5-efd3-4f2f-b625-d00f9d821d74","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.997679Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:dcd342f949511a165505097ed30bbcc042f2f7aee777876c52bd8e7c93169434","observation_id":"596bf4ce-e730-42b0-9445-d833dd1dfb38","resolution":{"observed_at":"2026-08-16T11:19:54.928503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.919305Z","title":"Chestxraybert: A pretrained language model for chest radiology report summarization","venue":null,"work_id":"5f0411c8-4b1e-44c4-8266-6fff13721800","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.000554Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:1abf75db5b209b7774b018c1384cbe50589ca2dee1df74de3f7b34e288ac09f5","observation_id":"59886bd7-7cdb-48b9-aa68-3812f75ccbfd","resolution":{"observed_at":"2026-08-16T11:19:54.921796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.912597Z","title":"Veasey and Amir A","venue":null,"work_id":"ca09822b-79b3-4972-85e9-4329b8c6f56a","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.003474Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2c027ea37f44830b33a91292444f4e4533c20e4bf8c1ed56a88f03a09dbd7473","observation_id":"816b93f7-812c-4e26-92b0-9e78b82497e9","resolution":{"observed_at":"2026-08-16T11:19:54.915461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.906379Z","title":"Castro, Benedikt Boecking, Harshita Sharma, Kenza Bouzid, Anja Thieme, Anton Schwaighofer, Maria Wetscherek, Matthew P","venue":null,"work_id":"0948d986-91a7-4fc0-bb58-6a4a45222f80","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.005547Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f728698a7154555c87799e082217e330e6b3551538c495b497a138643c7065da","observation_id":"8ea78d50-1ef8-4cff-8cfa-69a1f3276598","resolution":{"observed_at":"2026-08-16T11:19:54.908726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.899824Z","title":"O’Neil, and Sotirios A","venue":null,"work_id":"5a6a74a8-29ac-4545-beff-a2d034435d08","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.007726Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:ad5a571ab31edc7109d2d5386bdac8f9229323429f55ac70a186a3da4511e130","observation_id":"637f6442-71ae-415c-b13f-9b72478ee409","resolution":{"observed_at":"2026-08-16T11:19:54.902146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.893087Z","title":null,"venue":null,"work_id":"1d4a5159-899c-494a-8d05-c016769d63f8","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.010042Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:7376078197af56c57146e27abdbaadcb78aa65c4cb707801383abdf6d47b4c0b","observation_id":"3e8e2d93-7d14-4d61-b2a4-4fc22bf0f317","resolution":{"observed_at":"2026-08-16T11:19:54.895948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.885509Z","title":"Lungren, Hoifung Poon, and Akshay S Chaudhari","venue":null,"work_id":"07f5cd68-5369-4af8-8c65-0e58ea433b7c","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.012342Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:cd6b3dff363c9f4d7cbf054207671447e535b3d2d3b29b7307f8e1ad466e327b","observation_id":"62b0b60c-389b-49af-8c60-db5db267ffa7","resolution":{"observed_at":"2026-08-16T11:19:54.888370Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.878117Z","title":"Joint learning of localized representations from medical images and reports","venue":null,"work_id":"c77c2305-1bfc-4939-970a-136ff2373911","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.014730Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:eaa0db05df110bb3f6935c8bf4b1fb7cc4c0bf06e368b1a7d23bab3d9545a326","observation_id":"822ef058-ad5b-4019-986d-6afe6266d201","resolution":{"observed_at":"2026-08-16T11:19:54.880934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.868636Z","title":"Castro, Anton Schwaighofer, Stephanie Hyland, Maria Wetscherek, Tristan Naumann, Aditya Nori, Javier Alvarez-Valle, Hoifung Poon, and Ozan Oktay","venue":null,"work_id":"8a7502cb-0947-4c32-935e-b79d0e7ee726","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.017015Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:49e60df6a4c5bbf4382c7cc09def45d84646c70b6bfe3ab2054662eb7d2f16a6","observation_id":"9b074428-8de4-4d70-977b-593476dad94a","resolution":{"observed_at":"2026-08-16T11:19:54.873297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.860422Z","title":"Mapping medical image-text to a joint space via masked modeling","venue":null,"work_id":"8c0c7618-4772-4960-a846-3570e8214efb","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.019184Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:a32618722aa83737e3506d08589fb9cd8575233820c5520de4fc7d204c214bc2","observation_id":"6d067c51-dacd-4aa4-aa2d-9a0668d1df2f","resolution":{"observed_at":"2026-08-16T11:19:54.863667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01583","last_updated":"2024-02-26T10:35:03Z","snapshot_observed_at":"2026-08-16T14:30:10.226292Z","submitted_at":"2024-01-03T07:22:54Z","title":"Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques","version":2},"cited_work":{"arxiv_id":"2401.01583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01583","snapshot_observed_at":"2026-08-16T11:19:54.561606Z","title":"Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques","venue":"cs.CV","work_id":"61d8d956-4e1e-42a1-ae99-993a3f255c55","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.021205Z"},"links":{"cited_paper":"/paper/2401.01583","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:ac251e6e4775bdc42bdeaa95f8f8b336ce10652b27320b6369f801059ef3d0a4","observation_id":"04865055-7b8f-487a-91f6-e7cbb146cbb2","resolution":{"observed_at":"2026-08-16T11:19:54.564876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11352","last_updated":"2023-02-22T12:53:33Z","snapshot_observed_at":"2026-08-16T15:53:33.641066Z","submitted_at":"2023-02-22T12:53:33Z","title":"X-TRA: Improving Chest X-ray Tasks with Cross-Modal Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":"2302.11352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.11352","snapshot_observed_at":"2026-08-16T11:19:54.550863Z","title":"X-TRA: Improving Chest X-ray Tasks with Cross-Modal Retrieval Augmentation","venue":"cs.CV","work_id":"fa4d0cd1-c543-43e3-9d95-39c495709d20","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.024184Z"},"links":{"cited_paper":"/paper/2302.11352","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9e0f5895b7730446cbbcd2f5d9d6bf12812736b86128d4e3ac5ab94b716ca790","observation_id":"3b66ec60-b9b8-4788-b2ab-e1b39bbc0e43","resolution":{"observed_at":"2026-08-16T11:19:54.554556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10501","last_updated":"2025-02-07T09:52:01Z","snapshot_observed_at":"2026-08-17T22:20:08.396121Z","submitted_at":"2024-01-19T05:28:51Z","title":"Enhancing medical vision-language contrastive learning via inter-matching relation modelling","version":2},"cited_work":{"arxiv_id":"2401.10501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.10501","snapshot_observed_at":"2026-08-16T11:19:54.541479Z","title":"Enhancing medical vision-language contrastive learning via inter-matching relation modelling","venue":"cs.CV","work_id":"f39649ab-25d0-4f80-9d8f-fc58d505bcda","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.027135Z"},"links":{"cited_paper":"/paper/2401.10501","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:4faceb2e82b824813ec878e9892dc9ff5617d5d14500ec7f0a5c766e3dae9efc","observation_id":"19ae9c0f-ab33-4317-9dd3-600267ed1410","resolution":{"observed_at":"2026-08-16T11:19:54.544422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.851212Z","title":"Cross-modal prototype driven network for radiology report generation","venue":null,"work_id":"bbd081b5-cde3-4362-a87f-51e02cf98c07","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.029750Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:8c47e6cc5d82378516237f361bb8c06bcbef185f0fa542b9bc813b2df02c5e01","observation_id":"8220db20-d61a-4e91-804d-80c99dad23fb","resolution":{"observed_at":"2026-08-16T11:19:54.854276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.843721Z","title":"Semantic extension for cross-modal retrieval of medical image-diagnosis report","venue":null,"work_id":"436715d9-2e7a-4f4d-b200-bb5892442d99","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.031874Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:cd0415d3b466b7bc1885ab46187fdd06c3883aa1a1f9851a468401cfcd2abb55","observation_id":"103a92f6-78a6-4a8b-b33f-2788b30e4b18","resolution":{"observed_at":"2026-08-16T11:19:54.846181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.835380Z","title":"Fine-grained medical vision-language representation learning for radiology report generation","venue":null,"work_id":"ce649148-3b88-4b52-bc07-bb069712f420","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.035428Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f7827a8de98329de1beedbe9f121c8bb46cc139db54168becdf39f1bb2d6061b","observation_id":"e688590a-7fbf-4f45-8885-b12f532715cf","resolution":{"observed_at":"2026-08-16T11:19:54.837718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.828481Z","title":"Exploring vision language pretraining with knowledge enhancement via large language model","venue":null,"work_id":"5d8cfcb1-73c3-40e9-8fd1-afd77bfae132","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.038485Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f78c61e0de2ae84fa0f85a68327aa883bed2fa936b0fba35834ee176f21c081a","observation_id":"8e6fc0d6-d164-4dc2-a8f7-6f3383aefa55","resolution":{"observed_at":"2026-08-16T11:19:54.831780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.822063Z","title":"Manning, and Curtis P","venue":null,"work_id":"2f76ce21-9cef-4100-8161-b7bc04c37c4c","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.040744Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:52fe3189c21a128600c8ae3c8d1e7af5685c3965159ea9985499a793600bc01a","observation_id":"263b48aa-4b65-4e25-a02a-bdb5ab8cfa5d","resolution":{"observed_at":"2026-08-16T11:19:54.824389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.814363Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"900452ac-501d-485e-82b3-3372505630a7","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.043004Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:07455b32443a885196c8cade015464260205de3a4e25dc90d7390d45b48ab13c","observation_id":"bf0d6496-9546-471d-b486-6613070fa3af","resolution":{"observed_at":"2026-08-16T11:19:54.817162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.807277Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"e34f8326-f191-4079-b759-5968797f5a14","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.045181Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:6ade7ccae662e9309a365afec80f184c4025e958d2ef3872b07aca17bf577264","observation_id":"91d29367-be39-4e58-b666-f69fc8e7df49","resolution":{"observed_at":"2026-08-16T11:19:54.810147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.799042Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":"7e32aabe-1595-4ddf-b14b-48d2a25267c1","year":2015},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.048081Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9f321bf3309b0b184a348943717e3ff32b300bd4ca2fb4ea4d88a9f98d2c8bb2","observation_id":"2dc0d730-923d-495d-8e83-a907ca1728ae","resolution":{"observed_at":"2026-08-16T11:19:54.801781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-08-14T20:46:56.185352Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-16T11:19:54.051316Z","title":"Vse++: Improving visual-semantic embed- dings with hard negatives","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.051316Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:ef092557b9758004a69bd5b7fa993365ace9c8a701c877982b3b4a91f31e850c","observation_id":"59b3be12-b7fd-4ee0-b7a3-69a642f52f82","resolution":{"observed_at":"2026-08-16T11:19:54.051316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-16T14:25:27.106074Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-08-16T11:19:54.054240Z","title":"Tsai, Andrew Johnston, Cameron Olsen, Tanishq Mathew Abraham, Sergios Gatidis, Akshay S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.054240Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:a870935ac665cb634aafd0f9966350deb93f5516f66b653c615f44622598e080","observation_id":"1e6cb07a-bf17-4c4d-b22c-6df74011c9c7","resolution":{"observed_at":"2026-08-16T11:19:54.054240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.791521Z","title":"Harnessing the power of pre-trained vision-language models for efficient medical report generation","venue":null,"work_id":"9c03aff2-20d1-466b-bbf9-b82e98b0fa82","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.057667Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:8fe5259b4df4a480c87d244c6adb76552dbaeb3cf9934fc7e16204cee06ff359","observation_id":"fa9e114b-26aa-4045-8f0a-13699128deda","resolution":{"observed_at":"2026-08-16T11:19:54.794135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16022","last_updated":"2021-03-30T01:48:46Z","snapshot_observed_at":"2026-08-16T18:35:22.271462Z","submitted_at":"2021-03-30T01:48:46Z","title":"Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16022","snapshot_observed_at":"2026-08-16T11:19:54.060468Z","title":"Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.060468Z"},"links":{"cited_paper":"/paper/2103.16022","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:924b2198d25c41100a17227e96a64a21a6188f00c1abeaf73d0ff0c3c3dfd50d","observation_id":"c987a717-8fcf-49d0-9540-4765b001de56","resolution":{"observed_at":"2026-08-16T11:19:54.060468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.784739Z","title":"Multi-Granularity Cross-modal Alignment for Generalized Medical Visual Representation Learning","venue":null,"work_id":"32177151-551d-45d0-aee8-fbeda6396826","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.063746Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:af927e80caebc04f8706e8aa0cdb745f87ba3f0a86066669a34de6d1081ebb93","observation_id":"ce69ba26-2ed2-4c36-a198-a63dba98a84e","resolution":{"observed_at":"2026-08-16T11:19:54.787551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19894","last_updated":"2024-02-17T19:49:54Z","snapshot_observed_at":"2026-08-16T15:27:54.860103Z","submitted_at":"2023-05-31T14:28:19Z","title":"Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias","version":3},"cited_work":{"arxiv_id":"2305.19894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.19894","snapshot_observed_at":"2026-08-16T11:19:54.513166Z","title":"Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias","venue":"cs.CL","work_id":"be58d4aa-e1cf-46ce-81f0-dbc3ec785ba7","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.067399Z"},"links":{"cited_paper":"/paper/2305.19894","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:e19e3855fd878e4680a00c2855edaa572d9eb5f7c3dd47942a982ee9cef8e087","observation_id":"04fbedde-df51-40fa-a380-d11c65db51d0","resolution":{"observed_at":"2026-08-16T11:19:54.516730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.069886Z","title":"Nezhad, Gokberk Elmas, Bilal Kabas, Fuat Arslan, and Tolga C ¸ ukur","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.069886Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:c313c6118c607cd6f40d8adb072b61b13187c75f09b6fb284735af5f2feec47b","observation_id":"715ac64d-7b9a-46e3-bf05-4d29052adfb3","resolution":{"observed_at":"2026-08-16T11:19:54.069886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.072341Z","title":"Atli, Bilal Kabas, Fuat Arslan, Arda C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.072341Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:57416c82bd566eade206972fec7a865a5a8c4806c5886b81cbe14b8631e7c0bf","observation_id":"b91720ef-3362-4928-918d-41f25c599726","resolution":{"observed_at":"2026-08-16T11:19:54.072341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.777852Z","title":"Cxr-llava: a multimodal large language model for interpreting chest x-ray images","venue":null,"work_id":"b9e88f52-15e2-4ea8-846c-c4b95b9f8598","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.074547Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:70c03845c90b588c35079f7853e3544270d5f311c2c4ceede35f2c5e8249daea","observation_id":"7e636866-b002-4457-bdb9-642ce2a535de","resolution":{"observed_at":"2026-08-16T11:19:54.780369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.769930Z","title":"Collaboration between clinicians and vision– language models in radiology report generation","venue":null,"work_id":"74f87502-a1bc-465c-9490-78ba6badbe23","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.077685Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f598b9c72da9474633c9441d359aff9f877dca11ddf2979ea30c4350cda45731","observation_id":"88bd5a35-bc10-4839-8124-6d04c85e81e5","resolution":{"observed_at":"2026-08-16T11:19:54.773077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.762112Z","title":"Jay Kuo, Aichi Chien, and Kai-Wei Chang","venue":null,"work_id":"3178196e-3e12-402e-a2f1-849815045862","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.081070Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:323ef358d10c44a72432f2b8111e08a5c77ccb38ea828a46328a093563a21a0f","observation_id":"9507fc57-73b6-42d6-a7ba-d092e10814a1","resolution":{"observed_at":"2026-08-16T11:19:54.764598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.754214Z","title":"Self-supervised multi-modal training from uncurated images and reports enables monitoring ai in radiology","venue":null,"work_id":"9738289d-4810-418f-9d6f-1fee7133950e","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.083228Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:328482f1a6f60b6e24369a13ebf71cffb4e15dbfee2bd9d4f95b3cf96bc1884c","observation_id":"3d35144e-0ad6-41fd-9115-6e1031931dba","resolution":{"observed_at":"2026-08-16T11:19:54.757563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.744835Z","title":"Medklip: Medical knowledge enhanced language-image pre-training for x-ray diagnosis","venue":null,"work_id":"81f5138f-782b-4426-8975-314abe165c64","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.085919Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2a78052a26944da9c63cd36f9d6c92ea6c5ce1402391c1bdf08dcc5e03cc26ba","observation_id":"e80f701c-4f06-4dbc-8483-93d1d14de454","resolution":{"observed_at":"2026-08-16T11:19:54.748874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.734545Z","title":"Knowledge-enhanced visual-language pre-training on chest radiology images","venue":null,"work_id":"cb9bc220-b40a-4bf1-940f-7409e2831177","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.088667Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:7d060130b4ce6bd967ff5c8631481b662a904c7d4b107dfb558c873c074df643","observation_id":"a61f7804-7bce-42ef-997b-9f35786ae6bc","resolution":{"observed_at":"2026-08-16T11:19:54.737359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.726379Z","title":"Improving medical vision-language contrastive pretraining with semantics-aware triage","venue":null,"work_id":"20553f4a-728e-4b41-88fd-d22e534124d7","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.091182Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:09f2ae90325a785db71b7ee22fef62e6e18b027d33e9cf2726507f1b1e0561d4","observation_id":"c40a7be3-00c0-449f-be7e-4d9468f753fe","resolution":{"observed_at":"2026-08-16T11:19:54.729858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.715983Z","title":"Lungren, and Serena Yeung","venue":null,"work_id":"885f0d6c-3d86-41e3-b4ea-85ac2e8e5ce8","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.093829Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:564f465be05538309886f28bc00bc0b988d46ee79f97d20a63f2387355354053","observation_id":"7af6b796-b806-4c48-8b8d-86d703aad524","resolution":{"observed_at":"2026-08-16T11:19:54.719552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.708266Z","title":"A contrastive triplet network for automatic chest x-ray reporting","venue":null,"work_id":"1f6d594f-06aa-4cbf-bc55-6504f8d595ec","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.096705Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:3aa33c583ea9a1b3d6a02051fa1d904f4872016cb4dce2fd0338c12206001a4e","observation_id":"a9ded3ad-f45d-4d63-abee-9f691e80aa4c","resolution":{"observed_at":"2026-08-16T11:19:54.711054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07027","last_updated":"2024-04-30T12:37:13Z","snapshot_observed_at":"2026-08-16T14:53:16.952090Z","submitted_at":"2023-10-10T21:29:41Z","title":"Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07027","snapshot_observed_at":"2026-08-16T11:19:54.099736Z","title":"Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.099736Z"},"links":{"cited_paper":"/paper/2310.07027","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:1b1230e587dd2502b284e268b66cec493cdfed62d609009ac167c9405ea234f9","observation_id":"40b58e1a-b442-48d4-889f-1d74d7bad7df","resolution":{"observed_at":"2026-08-16T11:19:54.099736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01591","last_updated":"2024-01-03T07:54:13Z","snapshot_observed_at":"2026-08-16T14:30:10.150113Z","submitted_at":"2024-01-03T07:54:13Z","title":"MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning","version":1},"cited_work":{"arxiv_id":"2401.01591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01591","snapshot_observed_at":"2026-08-16T11:19:54.309253Z","title":"MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning","venue":"cs.CV","work_id":"c8a508e0-47da-4716-a90f-6fb1003c5a06","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.102346Z"},"links":{"cited_paper":"/paper/2401.01591","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:07bef22504d144bbde3f32f5308d4d0e18effbb769d0c04e91c771886654d0a0","observation_id":"ad878bb2-5827-41d3-a631-7e07ecf2511b","resolution":{"observed_at":"2026-08-16T11:19:54.313708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.698211Z","title":"Visual prior-based cross- modal alignment network for radiology report generation","venue":null,"work_id":"6d63100a-3ca3-4fea-a6f0-bebf64791079","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.104858Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:aed15024db370cbb18dfb8e341f9bca82fb4b66916f910b35de2e587162addbc","observation_id":"990da4b8-2ad1-4be9-9d57-08e6b97f01d1","resolution":{"observed_at":"2026-08-16T11:19:54.701517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.689136Z","title":"Unify, align and refine: Multi-level semantic alignment for radiology report generation","venue":null,"work_id":"e78cbb4a-ab72-4239-8f1a-111a0d85fd00","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.108084Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:49e7f69e392b7a2b99bf8fe9e145c097fd7b9e4bfc945e326e099eae5109f7c2","observation_id":"25f3f929-da01-4183-a34e-8106aa9494ca","resolution":{"observed_at":"2026-08-16T11:19:54.692405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.680770Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ab6acb3f-cc74-451b-b08b-acc9f66275ee","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.110278Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:dcfb1e00d11b4c10cb032d54d686a250fc9bf2224f43a758253f7fe0cf9741fa","observation_id":"baf9c301-f8dd-4bc3-82b5-625680e6e609","resolution":{"observed_at":"2026-08-16T11:19:54.683552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-16T16:23:03.490700Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-16T11:19:54.112689Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.112689Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:96b2e502e7eb6adc84533b73ab2d583987949ca599b4b2699e004ff6d7079242","observation_id":"7ffb0fba-852b-4a7e-bd28-250ad8fd5667","resolution":{"observed_at":"2026-08-16T11:19:54.112689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09294","last_updated":"2024-03-14T11:29:47Z","snapshot_observed_at":"2026-08-16T14:09:52.937942Z","submitted_at":"2024-03-14T11:29:47Z","title":"Anatomical Structure-Guided Medical Vision-Language Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09294","snapshot_observed_at":"2026-08-16T11:19:54.115544Z","title":"Anatomical Structure-Guided Medical Vision-Language Pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.115544Z"},"links":{"cited_paper":"/paper/2403.09294","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:4d2a43aae3ea8e15f54e05b96615eb07b4fafe71a9b35fd2bfac9c8926beb022","observation_id":"88614648-9708-4979-a726-5ca6fbf0e6c6","resolution":{"observed_at":"2026-08-16T11:19:54.115544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.670396Z","title":"KIA: Knowledge-guided implicit vision- language alignment for chest X-ray report generation","venue":null,"work_id":"69b15afd-97e9-480a-a552-cb1ca159c8a5","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.118468Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:78f6b9be7a9a67155ae0ce80c3159111a141f96fe581cff2b91a57661e7a3c6a","observation_id":"1692ab31-0c57-4df6-8b5c-1b1eae0a2e6f","resolution":{"observed_at":"2026-08-16T11:19:54.673950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.662413Z","title":"Content-based medical image retrieval with opponent class adaptive margin loss","venue":null,"work_id":"37e9c53f-b6df-453c-98f6-38348f0b3bb0","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.121012Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9ba07428eb758dbcaae0dc5eb2581753f69d25dc5bdf935d461b8e6865498e1c","observation_id":"ef268630-8f9a-4f6c-8bca-9eefd3617731","resolution":{"observed_at":"2026-08-16T11:19:54.665025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.655264Z","title":"Improving joint learning of chest X-Ray and radiology report by word region alignment","venue":null,"work_id":"e822e46c-3486-4701-9729-184cbd876345","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.123973Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:927a19184e557e0e8991de9dcccaa0ce11f31c4fd9a5334dfcffb6f4e928024a","observation_id":"05c7e3ea-7f54-4030-91ce-4e4610e41956","resolution":{"observed_at":"2026-08-16T11:19:54.657756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10185","last_updated":"2026-04-27T07:59:24Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:14:22Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10185","snapshot_observed_at":"2026-08-16T11:19:54.127733Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.127733Z"},"links":{"cited_paper":"/paper/2406.10185","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:ac2e30298cd146f40eb0c34d26edbc20b10a1fb56fe8d57bfc64ecb9758f5dd7","observation_id":"6b7b1299-3788-473c-a65b-a1d1cfe74d6e","resolution":{"observed_at":"2026-08-16T11:19:54.127733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.647156Z","title":"Ontology-based data integration between clinical and research systems","venue":null,"work_id":"f316be64-506c-4519-afa1-313fee719148","year":2015},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.130137Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:167feff10b4a906b86ed4212389c7eb47660060b804a12f6cf576f292b5e88b4","observation_id":"994633d0-e569-4967-b77a-2f5fe4543cc0","resolution":{"observed_at":"2026-08-16T11:19:54.649689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.639671Z","title":"Chexpert: A large chest radiograph dataset with uncer- tainty labels and expert comparison","venue":null,"work_id":"117fb1dc-8acc-44a4-a1d6-c96b943b82fc","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.132287Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:eedd72add6afaad3ab23315e9e16ab838ac33c20f0dba483f683b8b0506ed4f7","observation_id":"474d8eaf-cfd4-4917-9278-fa0596db1d54","resolution":{"observed_at":"2026-08-16T11:19:54.642121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.632298Z","title":"On the role of morphological information for contextual lemmatization","venue":null,"work_id":"f2ec8816-72e8-4853-9daa-7f175592913f","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.134875Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:b141fe3a349d029cb51d66a886be95dfe2db4f091a9b3e61e114b10c7b9ab089","observation_id":"365595c1-7051-47b4-8173-a45da7969305","resolution":{"observed_at":"2026-08-16T11:19:54.634982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.623575Z","title":"Optimizing the dice score and jaccard index for medical image segmentation: Theory and practice","venue":null,"work_id":"1f6e13e4-79e7-4092-b966-b8c84e7e37b1","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.138530Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:d259a83dbd72cf85a55f7a956aa31bbc91853fd60667ce5728a229efe4bfbff5","observation_id":"853646e6-4b31-4e4b-becf-16b540b926fa","resolution":{"observed_at":"2026-08-16T11:19:54.627066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T11:19:54.141249Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.141249Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:70e290237f217424fc84a77d0784fadcbc8a379774650e9c58e37d20f4a12f51","observation_id":"387cac0d-ccb1-490e-b716-3672f5ca0f69","resolution":{"observed_at":"2026-08-16T11:19:54.141249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.615009Z","title":"Spd manifold deep metric learning for image set classification","venue":null,"work_id":"2266c295-2703-4b7c-9373-342e7d7151cc","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.144203Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:0c4a68679f1596c34e35c4fb7d630e5eb0b19c8981ec6d1535965ee60fc53eab","observation_id":"fed4adc1-0a1d-453a-b87d-df9056fce35a","resolution":{"observed_at":"2026-08-16T11:19:54.617528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.607877Z","title":"Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports","venue":null,"work_id":"22bdffec-37ff-41e5-b0a8-82c382089b0e","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.232135Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:cc1cee3563fe4d263767fe183ebea91b217f33faab5a432a7973f9367a5ab654","observation_id":"d02e1505-b337-49fb-9cdc-e38fa8df57ff","resolution":{"observed_at":"2026-08-16T11:19:54.610369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.600359Z","title":"Wu, Safwan S","venue":null,"work_id":"64974557-9182-42fb-9ee6-e1f01418e96e","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.235026Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:53d45a6dd4b7f8466dfad683fdb301d880b86c4162a2f0c2d72272d2dd0e0a21","observation_id":"a879af72-761c-4cbb-86fc-a5171b1ffab0","resolution":{"observed_at":"2026-08-16T11:19:54.603576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03323","last_updated":"2019-06-20T20:41:58Z","snapshot_observed_at":"2026-08-14T16:50:51.644744Z","submitted_at":"2019-04-06T00:34:39Z","title":"Publicly Available Clinical BERT Embeddings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03323","snapshot_observed_at":"2026-08-16T11:19:54.238249Z","title":"Murphy, Willie Boag, Wei-Hung Weng, Di Jin, Tristan Naumann, and Matthew B","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.238249Z"},"links":{"cited_paper":"/paper/1904.03323","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:05c3116d3ea878ebcd3b7f4fa24a4fb5002cd5f2d126724e3d9c0a0f0835b761","observation_id":"c4f4229c-0ff5-43b1-9c7d-f2979e4dcb11","resolution":{"observed_at":"2026-08-16T11:19:54.238249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.593626Z","title":"Langlotz, Andrew Y","venue":null,"work_id":"c714296f-5c1e-4f18-a8d5-fe0171511c31","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.241569Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2fa78d07ad24fcf10097dab3ecac74622781ec78778cb9e7bb986575802e7eae","observation_id":"74f90dd6-534f-4680-8e25-3e5f67e589dd","resolution":{"observed_at":"2026-08-16T11:19:54.596329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.585895Z","title":"Medfilip: Medical fine-grained language-image pre-training.IEEE J Biomed Health Inf, 2025","venue":null,"work_id":"2349efd3-62bb-4d91-89b7-47a041d1cf69","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.243707Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:b5d6f25518123a23a6521986fe98e103c7bac00e5ba9757c9710f5f20b0ebb47","observation_id":"257152dc-0ef7-4635-a7c7-c1297cb3bd8d","resolution":{"observed_at":"2026-08-16T11:19:54.588851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.578210Z","title":"Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Batra","venue":null,"work_id":"9e052968-7bd1-4957-a759-8776abe71dc1","year":2017},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.246092Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f035707b877024c71d04534964e0a91c0dbaf2299a7129e94b723eed239320e0","observation_id":"d5d5aae8-200a-49d8-99b3-d6150cd5cdd7","resolution":{"observed_at":"2026-08-16T11:19:54.581272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.570515Z","title":null,"venue":null,"work_id":"818b7315-ce05-4958-bb70-9b180e6fc45e","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.248621Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:e94b2dcff371926438dafbe843ffd0f8bdefca9dbbe80c25cc92e0bbbdd56ab5","observation_id":"8d2e767b-7553-4851-b463-ed6a5eaa9a3a","resolution":{"observed_at":"2026-08-16T11:19:54.573407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06789","last_updated":"2024-05-10T19:39:55Z","snapshot_observed_at":"2026-08-16T13:53:38.242113Z","submitted_at":"2024-05-10T19:39:55Z","title":"Self-Consistent Recursive Diffusion Bridge for Medical Image Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06789","snapshot_observed_at":"2026-08-16T11:19:54.250832Z","title":"Self-consistent recursive diffusion bridge for medical image translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.250832Z"},"links":{"cited_paper":"/paper/2405.06789","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f90ebbf8750cbccd5e239c4c3a1ffe4b0dd7d79afa9e56d4e850294849f8db11","observation_id":"c1d13099-d181-47fc-8352-0a67eb8e0f6d","resolution":{"observed_at":"2026-08-16T11:19:54.250832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09331","last_updated":"2025-08-20T21:04:12Z","snapshot_observed_at":"2026-08-15T11:33:25.921792Z","submitted_at":"2024-12-12T14:59:56Z","title":"Physics-Driven Autoregressive State Space Models for Medical Image Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09331","snapshot_observed_at":"2026-08-16T11:19:54.253838Z","title":"Nezhad, Saban Ozturk, Emine U","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.253838Z"},"links":{"cited_paper":"/paper/2412.09331","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:40280e7025867fcf8217461f600e9530a3fcc1c14c475dd6accf6eda9f954209","observation_id":"945cc80b-952b-44ca-a50c-b86ae1a8857e","resolution":{"observed_at":"2026-08-16T11:19:54.253838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T18:52:55.706965Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":48},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2504.15929."}