{"as_of":"2026-08-08T02:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8a6174463a4b362961a79968a020e2572686d46fd0765f9786be26a3df51871","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:40:59.075135Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:09:06.139625Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:10:28.670574Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"cited_work":{"arxiv_id":"2507.07568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"211ea36f-a3ba-4122-843b-b206b4a92a8e","year":2025},"citing_paper":{"arxiv_id":"2604.13598","last_updated":"2026-04-15T08:08:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T08:08:06Z","title":"Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T14:09:06.139625Z"},"links":{"cited_paper":"/paper/2507.07568","citing_paper":"/paper/2604.13598"},"observation_digest":"sha256:736eb1899c4608c626eae6b7f35eab1dd1576535b0ad25caa0a205465ea6bfb3","observation_id":"5c7c268a-d65a-4457-a4fa-2afbffd5e22a","resolution":{"observed_at":"2026-05-10T14:10:28.672612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07568/citation-record","integrity":"/paper/2507.07568/integrity","json":"/paper/2507.07568/citation-record.json","paper":"/paper/2507.07568"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:54.634276Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.634276Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:62b3656e33f0542f1ba6c99728af2898042f08f85bdccca2d4a3c387de030398","observation_id":"78479a4d-5929-44c4-a896-406487b8c21b","resolution":{"observed_at":"2026-08-06T18:40:54.634276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:05.555199Z","title":"Instance-level expert knowledge and aggregate discrimina- tive attention for radiology report generation","venue":null,"work_id":"215f2f2c-da36-48d9-a41a-983f0a80aff7","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.698556Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:f2e4f32d3c44024887ce60abd84cebe320c70da5a5fbbb06cf3d73dbc6aad382","observation_id":"66c350e7-409e-48e6-b3ab-d8610a0fc357","resolution":{"observed_at":"2026-08-06T18:41:05.610400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08078","last_updated":"2024-06-04T12:27:38Z","snapshot_observed_at":"2026-07-06T17:01:00.985811Z","submitted_at":"2023-12-13T11:47:28Z","title":"Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08078","snapshot_observed_at":"2026-08-06T18:40:54.786069Z","title":"Fine-grained image-text alignment in medical imaging en- ables cyclic image-report generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.786069Z"},"links":{"cited_paper":"/paper/2312.08078","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:abcd4eb3f6dbf18b9f6e4ebf58dc362e16f460abbd5294208ccbf92d67e3de72","observation_id":"a3ec215e-a41d-40fe-81a3-32556a435ba6","resolution":{"observed_at":"2026-08-06T18:40:54.786069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.16056","last_updated":"2022-04-28T01:16:11Z","snapshot_observed_at":"2026-08-07T11:49:12.409435Z","submitted_at":"2020-10-30T04:08:03Z","title":"Generating Radiology Reports via Memory-driven Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.16056","snapshot_observed_at":"2026-08-06T18:40:54.869300Z","title":"Generating radiology reports via memory-driven trans- former","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.869300Z"},"links":{"cited_paper":"/paper/2010.16056","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:b0ece251a025f88babb49971e304ceb48db72ec79327da3c11bbb03b86df2a4c","observation_id":"d504dc60-88db-48ec-b52f-f26993d8d51c","resolution":{"observed_at":"2026-08-06T18:40:54.869300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.13258","last_updated":"2022-04-28T02:32:53Z","snapshot_observed_at":"2026-08-06T22:43:19.014396Z","submitted_at":"2022-04-28T02:32:53Z","title":"Cross-modal Memory Networks for Radiology Report Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.13258","snapshot_observed_at":"2026-08-06T18:40:54.940751Z","title":"Cross-modal memory networks for radiology report gener- ation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.940751Z"},"links":{"cited_paper":"/paper/2204.13258","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:b2a697e66880092e6f004fd90fb88fdcf44b12d27e5dcf8e0ad508290ff42970","observation_id":"9d6a7184-3743-452e-b37b-29994f9f3119","resolution":{"observed_at":"2026-08-06T18:40:54.940751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:55.064495Z","title":"Meshed-memory transformer for image cap- tioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.064495Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:d33f23208786ccca5abb7c4adca7aa4a269c05d433b628d4bd02b1b11b79e98c","observation_id":"52a97cc1-afeb-4dec-95d9-80a01c7c7f76","resolution":{"observed_at":"2026-08-06T18:40:55.064495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:05.376986Z","title":"To- wards diverse and natural image descriptions via a condi- tional gan","venue":null,"work_id":"265d3a5c-bf4a-40b3-9bab-f3113e34eafb","year":2017},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.148019Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:3e61df91e385da02dae0ec80a6c3fdbc4aee255cb5dc69d1ea595a4bf55024e6","observation_id":"e2f3b51a-843d-4293-9f9d-eec123549feb","resolution":{"observed_at":"2026-08-06T18:41:05.462231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:05.207125Z","title":"Meteor 1.3: Automatic metric for reliable optimization and evaluation of machine translation systems","venue":null,"work_id":"f754bc76-018a-4f24-a94f-98d9f11f589c","year":2011},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.209257Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:861a5de3cad6dff850efdbf63d14d794f0a32280e0d00244a5eca90bd9458ee4","observation_id":"e41aad48-9aba-4b14-8f8b-079ca4ba5034","resolution":{"observed_at":"2026-08-06T18:41:05.278577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:05.046655Z","title":"Long short-term memory","venue":null,"work_id":"75772ff7-8126-4a0d-8327-95d53a7f77cd","year":2012},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.323303Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:8954d3ea2a52c045add8d0f3a00a925cc2f4c8271252f80bb2a9a4a99b46013a","observation_id":"444720c9-34f8-4b33-ba88-03685b39b303","resolution":{"observed_at":"2026-08-06T18:41:05.109519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.898104Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":"5a5d431a-4350-45ba-87d4-df1e29f14a3f","year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.433036Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:65f961fff8946039327f8a85ec5acb9cc18330a8da1647aeeeb638878a73ce20","observation_id":"69c3d97e-2961-4c1f-a040-89f0b82b9409","resolution":{"observed_at":"2026-08-06T18:41:04.969520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.667517Z","title":"Kiut: Knowledge-injected u-transformer for radiology report generation","venue":null,"work_id":"9f8dc77d-42ce-42ef-98c1-940d2aeef113","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.534153Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:36a9ae2bff16c6a225ba7115d3a32262ba6a00bd33619426e248e2e05b64c8fc","observation_id":"fd4f6c4e-9dfe-4597-9e56-c1c3019e36e6","resolution":{"observed_at":"2026-08-06T18:41:04.768171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.534130Z","title":"Chexpert: A large chest radiograph dataset with uncertainty labels and expert comparison","venue":null,"work_id":"3623ad57-054d-4dd7-a4a9-7af5f7e43079","year":2019},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.655311Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:5ad4bb6ff7bda6d3d5c8c983fbc9c43b506d28a195fff9436a9f0accdd33f3fc","observation_id":"b3f8e06e-977d-4568-84cd-db6808602b1d","resolution":{"observed_at":"2026-08-06T18:41:04.578931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.330525Z","title":"Promptmrg: Diagnosis-driven prompts for medical report generation","venue":null,"work_id":"47602fa3-7119-4aab-8530-b5d7a10d1482","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.760521Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:613cf12954cfdc3d0498a3b3797a02425ac13b9ae407e9cd91798322cf76c566","observation_id":"66150774-7d3f-42a1-96e6-d9944ecf8717","resolution":{"observed_at":"2026-08-06T18:41:04.442761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.194568Z","title":"Zero-shot camouflaged object detection","venue":null,"work_id":"c6da83a8-b20d-4f02-b858-a3b84da63f13","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.898674Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:3ae839834a70704c53331364c91611a4cbaafc687f066f2c5e777fb6c691c9f0","observation_id":"5b4ef1b4-7b98-4a38-993f-91d441f63684","resolution":{"observed_at":"2026-08-06T18:41:04.318825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:03.481437Z","title":"Dynamic graph enhanced contrastive learning for chest x-ray report generation","venue":null,"work_id":"5741081a-28e5-44a5-b002-96fb0d0c2104","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.011195Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:5e60666e5e9ce9527b8d890eb4d8625573b4d205f9efc2c0477165fd0c8204a8","observation_id":"baffaa0e-0a8a-4797-b2e5-e7060b176690","resolution":{"observed_at":"2026-08-06T18:41:03.750014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:03.232476Z","title":"Unify, align and refine: Multi- level semantic alignment for radiology report generation","venue":null,"work_id":"741b2dba-8444-439e-9a78-dfd1e0183101","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.141380Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:385c474e16b6790c277fd91a4c9b188c752e3c9b2849912e05ffa4f105dae26a","observation_id":"db6feba9-9b44-4b77-87e1-a16bb8ee3b6e","resolution":{"observed_at":"2026-08-06T18:41:03.303434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:56.262544Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.262544Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:99e2a0d50a3084ff141c40dd27073f74a44de0953f4d01bbc3bbae474c0e1a96","observation_id":"445c98da-8d75-4fc3-9628-def98b1f73b0","resolution":{"observed_at":"2026-08-06T18:40:56.262544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:03.073959Z","title":"Exploring and distilling posterior and prior knowl- edge for radiology report generation","venue":null,"work_id":"4319bce9-750c-4e91-809e-0de5c13a2497","year":2021},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.361215Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:f615549fe96f4d84c1cad8a15bf8b538100423aef54d7bf1a8776a2750c80311","observation_id":"3e1d39db-f330-47b2-b6be-84e91f921b60","resolution":{"observed_at":"2026-08-06T18:41:03.132064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.802578Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection, 2024","venue":null,"work_id":"260b868c-3250-409f-8eaa-513d0a6a22da","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.507414Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:c83bc686a81abc7aa4ddfa68009f64f63e174c8619a80b0826aceb15c31fbe4e","observation_id":"26596a90-efe7-46db-97ae-9bbbeb7ec035","resolution":{"observed_at":"2026-08-06T18:41:02.954214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.611435Z","title":"Knowing when to look: Adaptive attention via a visual sen- tinel for image captioning","venue":null,"work_id":"3557f38b-0b81-4925-8bce-ffb02d91c178","year":2017},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.639657Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:091c35dea68eb22ec4686c2592335e437801658d335c49e70c4b9ee56a9de04c","observation_id":"c30f39ce-c50a-4523-a79e-52880908d818","resolution":{"observed_at":"2026-08-06T18:41:02.739319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.425395Z","title":"Im- proving chest x-ray report generation by leveraging warm starting","venue":null,"work_id":"0d1455ae-8262-47f8-bcac-3ce5cc378849","year":null},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.748965Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:56d0053a43bdf2bd20945fbc16c04e168862b6bab52b9ba301b8b76bf8324362","observation_id":"f1115d3c-2adf-4404-beba-d14d20bf12da","resolution":{"observed_at":"2026-08-06T18:41:02.508737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09777","last_updated":"2021-08-31T17:57:10Z","snapshot_observed_at":"2026-07-06T10:42:44.947174Z","submitted_at":"2021-02-19T07:42:13Z","title":"Progressive Transformer-Based Generation of Radiology Reports","version":3},"cited_work":{"arxiv_id":"2102.09777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.09777","snapshot_observed_at":"2026-08-06T18:40:59.202487Z","title":"Progressive Transformer-Based Generation of Radiology Reports","venue":"cs.CL","work_id":"89301ab1-22c8-4319-be77-e68d7bbbb43d","year":2021},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.851674Z"},"links":{"cited_paper":"/paper/2102.09777","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:425f6e85ba7c3e9b739b7fb9430a79a22e6d991569a780ae7690e3957f87241c","observation_id":"7600f648-b485-4dec-a247-a68a9f9f67cb","resolution":{"observed_at":"2026-08-06T18:40:59.265156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08458","last_updated":"2015-12-02T18:06:03Z","snapshot_observed_at":"2026-07-06T04:37:52.737823Z","submitted_at":"2015-11-26T17:45:01Z","title":"An Introduction to Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08458","snapshot_observed_at":"2026-08-06T18:40:56.975156Z","title":"An introduction to convolutional neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.975156Z"},"links":{"cited_paper":"/paper/1511.08458","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:32ea3cd944babfab2b7620303fc190ce67caffc2d3090e1cc6e669e28bde0ab5","observation_id":"481197d6-1da4-4f23-a372-1101e123d7bb","resolution":{"observed_at":"2026-08-06T18:40:56.975156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.192034Z","title":"X-linear attention networks for image captioning","venue":null,"work_id":"bfb76f37-06b4-45f0-b714-59c775b0149a","year":2020},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.092731Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:bc8678d075a46cbd65c6cf8f87c336d285323ed923cf89a1b383d71e46f561fa","observation_id":"8a47ff2b-b8ab-4ff7-8152-aeba2f888650","resolution":{"observed_at":"2026-08-06T18:41:02.280231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:57.192845Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.192845Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:fc3b7fb8051ada1a9a716f97a04b36220d9283bf5fe1366ac289ceddcc2a230a","observation_id":"399b2de2-7ed2-4d59-b049-64f5531a590b","resolution":{"observed_at":"2026-08-06T18:40:57.192845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.999735Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"2b937b1a-d914-414d-87d5-36fb6936904a","year":null},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.300223Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:b4333b5a968b0f8e0287c2cfd48fc7fb9d2ff6f5abf1271ac9cbdec1f1f42719","observation_id":"2279dcf1-cd36-4f63-90c1-8bcec903b8a5","resolution":{"observed_at":"2026-08-06T18:41:02.077441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09167","last_updated":"2020-10-18T20:30:22Z","snapshot_observed_at":"2026-07-06T09:13:37.575194Z","submitted_at":"2020-04-20T09:46:40Z","title":"CheXbert: Combining Automatic Labelers and Expert Annotations for Accurate Radiology Report Labeling Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09167","snapshot_observed_at":"2026-08-06T18:40:57.387664Z","title":"Chexbert: com- bining automatic labelers and expert annotations for accu- rate radiology report labeling using bert","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.387664Z"},"links":{"cited_paper":"/paper/2004.09167","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:8ceac9511b2c755eaa0c7e931914b4e616a172153b7d6639e89803a2bce093a1","observation_id":"6cbdd847-1624-48ba-bea7-e050a2f5ce2f","resolution":{"observed_at":"2026-08-06T18:40:57.387664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.807081Z","title":"Interactive and explainable region-guided radiol- ogy report generation","venue":null,"work_id":"dd7126f0-4d02-4d9e-88f2-728a376c5df2","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.521412Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:3f38f7a2759d496eb35806c0c96980c78adcad23fb5cf4ee05e074d2e8198bbb","observation_id":"bb509744-ab22-429f-9980-1e8dc68f5de1","resolution":{"observed_at":"2026-08-06T18:41:01.885758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:57.653944Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.653944Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:f00d022b135bdeb9a1f1fa90d047eba00eff98141e641fd5fa5567ea5a74a99f","observation_id":"9f787231-8d18-4ab0-b334-5b4bb60b2e60","resolution":{"observed_at":"2026-08-06T18:40:57.653944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.450496Z","title":"Hergen: El- evating radiology report generation with longitudinal data,","venue":null,"work_id":"125ebbd6-6b3a-40a2-b070-f97820b3e0a6","year":null},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.808493Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:1e875bd25e835dc8227fd4bcb0878e26d17ad4ccce334863b424b659c27f5827","observation_id":"726f4580-4d9c-4fb2-a79d-9b8813b37521","resolution":{"observed_at":"2026-08-06T18:41:01.679143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.312440Z","title":"Cross-modal pro- totype driven network for radiology report generation","venue":null,"work_id":"a39cb7b4-3019-4685-b2de-d2cb0d2fa59e","year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.876827Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:4963bcdb8e78d00f4381f837d2ea52055f3f4264608a9212759cac4988950a82","observation_id":"dc82586b-a8f1-4b1b-a1e6-cee1f9b0c2b3","resolution":{"observed_at":"2026-08-06T18:41:01.372332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.177321Z","title":"Multi-view feature fusion and visual prompt for remote sensing image captioning","venue":null,"work_id":"caf51042-4ae8-4a2b-974a-08a5a1fababd","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.968629Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:baf1055cc889a18992291df3c75dcfbf709511484db522d72f3ebe8a2a9e06aa","observation_id":"b743310e-a002-4e63-b0ea-cbe3e98c47af","resolution":{"observed_at":"2026-08-06T18:41:01.242470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.895762Z","title":"Medclip: Contrastive learning from unpaired medical images and text, 2022","venue":null,"work_id":"e6a7dc67-0934-4453-8a8b-260c22fd9db0","year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.066074Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:b179cfc62a5d7568342cc8ab336d72c9b6c012ef199b99be0f9741a08119622b","observation_id":"777f3ed9-0a61-4858-a7bf-c2a69703f466","resolution":{"observed_at":"2026-08-06T18:41:01.050486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.640978Z","title":"Metransformer: Radiology report generation by transformer with multiple learnable expert tokens","venue":null,"work_id":"d771bee6-9a5a-49a0-8a62-6770f17b2d83","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.159836Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:f45c28566abb72b9beafcc23d0eb455f670552b39678420b21450b5dd155db1e","observation_id":"81bd850c-94a1-4f1e-9f70-de01d224ba5b","resolution":{"observed_at":"2026-08-06T18:41:00.765205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.389993Z","title":"Medklip: Medical knowledge enhanced language-image pre-training in radiology, 2023","venue":null,"work_id":"a0ec3709-7c6f-4dae-9358-6d1b9a955959","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.283944Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:b01bc670ec7479e59fc67f8a35f66fdcf9c35ff00e0bb7dec2b400ff68450b61","observation_id":"00e48e2c-8dbf-4bc5-a4ec-39c6a2f85fcf","resolution":{"observed_at":"2026-08-06T18:41:00.516888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.137876Z","title":"Clinical-bert: Vision-language pre-training for radiograph diagnosis and reports generation","venue":null,"work_id":"99718669-9972-4332-b645-7f5e02898b68","year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.395579Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:b12a9987bf2d41788cef24399cb474da6706b05f8ff40271aeb0bcb64f6eba48","observation_id":"ca36f8da-a3e4-4651-88e2-b907d02e5427","resolution":{"observed_at":"2026-08-06T18:41:00.236712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.035079Z","title":"Knowledge matters: Chest radiology report genera- tion with general and specific knowledge","venue":null,"work_id":"2b66f6be-e5a5-4b5f-a0b3-00c344401a5b","year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.484139Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:1f341b9ec372ab294f54263316ae3e8be9d6bb11c505d3704eb25c248421cb66","observation_id":"a1c43eb3-35d8-4341-8c96-d4285d96a71d","resolution":{"observed_at":"2026-08-06T18:41:00.110219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.935162Z","title":"Radiology report generation with a learned knowledge base and multi-modal alignment","venue":null,"work_id":"47031cf8-aac8-4dab-97c5-9696e0e3f0d4","year":2023},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.584779Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:6f3d774a73372973ca9826290028c9933db33fbd0401547f1067d750b87440ce","observation_id":"3a4ab974-bc06-472f-a825-8bb259196c28","resolution":{"observed_at":"2026-08-06T18:40:59.972046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.791218Z","title":"Improving hyperbolic representations via gromov- wasserstein regularization","venue":null,"work_id":"390670be-9745-4673-8e3f-781e1d15a0d7","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.684853Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:1c8fd63bcc4acf9dee571e3be7ce18484550cea6d89917cea2e721bd75683bef","observation_id":"fc0a99fe-33e2-4751-b791-a7d51508a97f","resolution":{"observed_at":"2026-08-06T18:40:59.865065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.653391Z","title":"Otseg: Multi-prompt sinkhorn attention for zero-shot semantic segmentation","venue":null,"work_id":"74a7ccd1-ac0d-4e6e-82a2-a39469e7f4e7","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.767838Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:11276a3000e51a38d52173b35eea2931f4370c8b9686ff7e133e2a1f1adf0d86","observation_id":"61a4302a-1b9b-4391-b4d0-5c6efedcccd2","resolution":{"observed_at":"2026-08-06T18:40:59.719371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T18:40:58.884213Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.884213Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:ffcac157901879e0138177885cfc2e05ee708afb17716a97a71e781639679347","observation_id":"6f210f77-71be-4632-afa1-6bd23d153e4a","resolution":{"observed_at":"2026-08-06T18:40:58.884213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.497755Z","title":"Anatomy-guided weakly- supervised abnormality localization in chest x-rays","venue":null,"work_id":"fe38f144-3728-4766-af7e-6e3bcd8f27ff","year":null},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:58.967913Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:71d20444375ea81d934eda5b25e08174577e35da97a8b9d27d5b3f01ddd3c6df","observation_id":"59a90ce7-959b-4231-9389-27b178fc4b20","resolution":{"observed_at":"2026-08-06T18:40:59.576735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.379646Z","title":"Sam-guided enhanced fine-grained encoding with mixed semantic learning for medical image captioning","venue":null,"work_id":"a3766dbf-10ae-4c14-a6cb-78e336d77aad","year":2024},"citing_paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:59.075135Z"},"links":{"citing_paper":"/paper/2507.07568"},"observation_digest":"sha256:f6b7ee54fdd853848eda1da4f441ff0a62fed5b4f21ea3c63bf78d688e32b744","observation_id":"21525339-621f-46bf-876d-c7d8cecf6915","resolution":{"observed_at":"2026-08-06T18:40:59.428509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07568","last_updated":"2025-07-10T09:13:10Z","latest_version":1,"primary_category":"stat.ME","snapshot_observed_at":"2026-08-07T11:49:45.403355Z","submitted_at":"2025-07-10T09:13:10Z","title":"Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2507.07568."}