{"as_of":"2026-08-07T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab13777f9d2f5451ddaa8022258416a9721ec1f21d4b944eceed5522fd1b1c5e","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:54:42.017223Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:40:02.719163Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:40:04.174660Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"cited_work":{"arxiv_id":"2507.04333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04333","snapshot_observed_at":"2026-08-06T15:40:04.174660Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","venue":"cs.CV","work_id":"14affe70-ab59-4782-8e70-ed5cfc3d5f11","year":2025},"citing_paper":{"arxiv_id":"2507.15275","last_updated":"2025-07-21T06:23:16Z","snapshot_observed_at":"2026-08-06T15:33:46.203127Z","submitted_at":"2025-07-21T06:23:16Z","title":"ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:02.719163Z"},"links":{"cited_paper":"/paper/2507.04333","citing_paper":"/paper/2507.15275"},"observation_digest":"sha256:0b9ebf7d157c572f87cd95af99ee2c976a54d15e843b423408b5a7a19b65b211","observation_id":"031fe5a1-7450-4ea2-a2a6-e9de644ef2db","resolution":{"observed_at":"2026-08-06T15:40:04.259081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04333/citation-record","integrity":"/paper/2507.04333/integrity","json":"/paper/2507.04333/citation-record.json","paper":"/paper/2507.04333"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:43.055500Z","title":"Visual question answering in the medical domain based on deep learning approaches: A comprehensive study,","venue":null,"work_id":"d55422c3-2b7e-416f-9846-d0ee6303312d","year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.663180Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:e64cff563d14f6677f623e3d79199b6854e4dd97904b630583b9c3c9f46fdc50","observation_id":"cdfddc5f-b514-4ce2-9404-2f56f22e5eaa","resolution":{"observed_at":"2026-08-06T19:54:43.061470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:43.038696Z","title":"Vqa: Visual question answering,","venue":null,"work_id":"7b0951cf-6e91-4e20-a3d7-e715fb95851f","year":2015},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.709244Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:26b02201cc6748acd135718c9feb91228d9292e2f9aac95d968e077089dcd224","observation_id":"ddc0eda4-10d4-4da1-baf7-db45e5a6faca","resolution":{"observed_at":"2026-08-06T19:54:43.043767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-07-06T17:53:35.219482Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-06T19:54:39.777120Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.777120Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:909125c70f09b61990b26c7a9cd0b160eac6f1d65484d98bde833b9abcd427b7","observation_id":"e3ea3aeb-2a9b-4ddc-9717-3d168e17b137","resolution":{"observed_at":"2026-08-06T19:54:39.777120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:43.019759Z","title":"Vqa-med: Overview of the medical visual question answering task at imageclef 2019,","venue":null,"work_id":"2693fd08-8639-42d5-849a-3cdf0a0ddf76","year":2019},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.811230Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:7e31f96048ec6e3dba751fc99b709f1c4274708c419f4b7d64dc26d5289a7262","observation_id":"4b92d35e-3bf6-46ba-9d77-a7d3eaaba66f","resolution":{"observed_at":"2026-08-06T19:54:43.027402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:43.002086Z","title":"Simvqa: Exploring simulated environments for visual question answering,","venue":null,"work_id":"506cbbb9-f8c2-425a-9bf5-a21a49593b19","year":2022},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.907255Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:de686337d354ca3c5a17e98f8ac62e3b2eaaf7bc3d185a6d3bd4af66d9ada13e","observation_id":"786cbd93-d63f-4ab0-8bfd-573add25b31d","resolution":{"observed_at":"2026-08-06T19:54:43.008144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.984360Z","title":"Miss: A generative pre-training and fine-tuning approach for med-vqa,","venue":null,"work_id":"f049a599-2970-4121-bc05-fd8dff1a49c7","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.979389Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:ff929c327fca835b2b17a879ac1172619731cebd1986a54d927de42da0597dbc","observation_id":"9ffd5b60-c7e6-45fd-99ee-88b59877c3f3","resolution":{"observed_at":"2026-08-06T19:54:42.990324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06468","last_updated":"2021-04-13T19:18:19Z","snapshot_observed_at":"2026-08-04T20:31:36.034886Z","submitted_at":"2021-04-13T19:18:19Z","title":"ViT-V-Net: Vision Transformer for Unsupervised Volumetric Medical Image Registration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06468","snapshot_observed_at":"2026-08-06T19:54:40.019082Z","title":"Vit-v-net: Vision trans- former for unsupervised volumetric medical image registration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.019082Z"},"links":{"cited_paper":"/paper/2104.06468","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:a07de32c1bca3c90fb76d12a7f85fce40988ace7a10e5c38c846959c22906250","observation_id":"29f587bf-5b17-4c0c-9b87-6a3ca3ce5fc5","resolution":{"observed_at":"2026-08-06T19:54:40.019082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.967160Z","title":"Counterfactual samples synthesizing for robust visual question answering,","venue":null,"work_id":"b24c6c00-0db0-4da6-b015-d62680cec46b","year":2020},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.102925Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:d3445ad7877ed69e0e14bce61d8547263cd49038841113778551350a1e2349e0","observation_id":"7400de3f-c074-4436-9a0c-ca365b656cb0","resolution":{"observed_at":"2026-08-06T19:54:42.972457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.949759Z","title":"Generative bias for robust visual question answering,","venue":null,"work_id":"f2e467cb-b056-413d-b908-f27764f9c111","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.264141Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:d8d3681ff18d48b4d97508322bf4db194bd7a1addecf1ce061465e8905110a0e","observation_id":"9fd29176-115b-4431-987d-16ffce950dfc","resolution":{"observed_at":"2026-08-06T19:54:42.955214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.931784Z","title":"BERT: Pre- training of Deep Bidirectional Transformers for Language Un- derstanding,","venue":null,"work_id":"09dffb17-0454-40d1-a5e8-2774b3cd51ea","year":2019},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.394270Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:b4d46b15180d0e3925625d21de1fbaf16cd9e5a69fc7d9a0b07599b697d3a5e5","observation_id":"5b554d4f-c8ed-40fe-aa2b-b17b739ff30d","resolution":{"observed_at":"2026-08-06T19:54:42.938116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.914030Z","title":"Mukea: Mul- timodal knowledge extraction and accumulation for knowledge- based visual question answering,","venue":null,"work_id":"18c58bb6-f13a-4e12-b22b-e1b8db78cca1","year":2022},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.503431Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:52c96b5f95b09b7d9caeabeb6c9f45e08620d3ad56c1d20ef83d808caaed9e7e","observation_id":"cbc6d438-742b-4940-9d4e-762ac3f04bb1","resolution":{"observed_at":"2026-08-06T19:54:42.920561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.897513Z","title":"Cross-modal self- attention with multi-task pre-training for medical visual question answering,","venue":null,"work_id":"b89753aa-dcd0-460f-a355-4ea7e27f1b28","year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.551231Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:81b8cc5bc891a31472f5f4330454d80bdce6c67995149931cf121fb5c9c030ad","observation_id":"f0e9e18b-128d-4acf-93cb-99e080d08ab9","resolution":{"observed_at":"2026-08-06T19:54:42.903089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.880014Z","title":"Swapmix: Diagnosing and regularizing the over-reliance on vi- sual context in visual question answering,","venue":null,"work_id":"8097de01-5287-447d-8ad4-f956c09a01cb","year":2022},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.697192Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:1d0df5126f13418945b22b91cf9e52a78d1326d43bcb656d72d79069cfc10156","observation_id":"b876a9f9-38b9-4a8e-9484-8c8da478034b","resolution":{"observed_at":"2026-08-06T19:54:42.885488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:54:40.822270Z","title":"LoRA: Low-rank Adaptation of Large Language Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.822270Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:fbb9a6e11529bf5ea3d753044519cee2183b7c6ea659a512b674cfc1bd34c19d","observation_id":"8a9d93d2-7440-4750-903d-2566f9cad3b4","resolution":{"observed_at":"2026-08-06T19:54:40.822270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.861515Z","title":"Expert knowledge-aware image dif- ference graph representation learning for difference-aware med- ical visual question answering,","venue":null,"work_id":"4736ab45-2a52-4883-8765-8af755a8979f","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:40.942191Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:eca7dd20c0bc8a3e9338406ad40aacac9fc6ee1b0633ecce38e97b5ab30c7175","observation_id":"64ad1017-e69b-42ae-876b-bae7a793728c","resolution":{"observed_at":"2026-08-06T19:54:42.867569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.842751Z","title":"Interpretable medical image visual question answering via multi-modal relationship graph learning,","venue":null,"work_id":"6db96f89-8ed8-4c14-826e-f02e14d551d9","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.060460Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:2313ed2640d825c632f0ba468e40a8b875cd3f35ccafd08fba63f576b5f5da4c","observation_id":"906e60f6-5ff6-4529-b100-95a3014009bc","resolution":{"observed_at":"2026-08-06T19:54:42.848294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.824041Z","title":"Medical knowledge-based network for patient-oriented visual question answering,","venue":null,"work_id":"e5fa83e1-6ab1-471f-a37b-393d188e7ea4","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.185112Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:e3f8d654d665075cab79565ea280940f880419ea5dd416fe9d8b8266a355638f","observation_id":"77f33150-ef03-4d0b-87ad-4ccc5fcf1df1","resolution":{"observed_at":"2026-08-06T19:54:42.829605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T19:54:41.237191Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.237191Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:78e33685b85392a3cc94c400a562aafce1ba3dd2b11b69374f80edc1c19bc864","observation_id":"89b3a497-9e5f-45f0-a3de-9d2c292a3ee9","resolution":{"observed_at":"2026-08-06T19:54:41.237191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02907","last_updated":"2017-02-22T09:55:36Z","snapshot_observed_at":"2026-07-06T05:10:16.862707Z","submitted_at":"2016-09-09T19:48:41Z","title":"Semi-Supervised Classification with Graph Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.02907","snapshot_observed_at":"2026-08-06T19:54:41.321445Z","title":"Semi-supervised classification with graph convolutional networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.321445Z"},"links":{"cited_paper":"/paper/1609.02907","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:0172978969b1556a270e8cba3d233c23cddfff11efa1fa5187faeaa8f78024d6","observation_id":"e6561164-6493-4360-a892-f3787ed728d3","resolution":{"observed_at":"2026-08-06T19:54:41.321445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13558","last_updated":"2024-12-18T07:19:48Z","snapshot_observed_at":"2026-07-06T20:09:00.586421Z","submitted_at":"2024-12-18T07:19:48Z","title":"Read Like a Radiologist: Efficient Vision-Language Model for 3D Medical Imaging Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13558","snapshot_observed_at":"2026-08-06T19:54:41.430371Z","title":"Read like a radiologist: Efficient vision-language model for 3d medical imaging interpretation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.430371Z"},"links":{"cited_paper":"/paper/2412.13558","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:547b7877d49d7a0cb34ffaab5e6dfc46ecf57ad5edaaf342c1a272c3d4204224","observation_id":"113ddaa5-fc12-4d78-8e4d-26fc1b1faf5f","resolution":{"observed_at":"2026-08-06T19:54:41.430371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.806530Z","title":"Llava-Med: Training a large language-and-vision assistant for biomedicine in one day,","venue":null,"work_id":"2c1d82b4-7756-491f-a1c5-bdfda442fa60","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.598103Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:9c101f17ffcacc9af97dfabb73e46b708bee0321ade08e0f6f3c5c2bd38d94a6","observation_id":"8d7de044-3070-45b6-bfe0-20565c669ab1","resolution":{"observed_at":"2026-08-06T19:54:42.811977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.789748Z","title":"Dynamic graph enhanced contrastive learning for chest x-ray report genera- tion,","venue":null,"work_id":"49e9c6fc-41b5-4298-a6c5-fcccfb6f3d50","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.702930Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:3ff7fce30d0d4cd410779cb3f13913ba518184cf71323e5ee4623596eec78551","observation_id":"f31ac35f-ec96-4c78-b9a4-ae30d892f3db","resolution":{"observed_at":"2026-08-06T19:54:42.794830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.771656Z","title":"Masked vision and language pre-training with unimodal and multimodal contrastive losses for medical visual question answering,","venue":null,"work_id":"21ae1929-b943-4ea8-ad96-bf19bc9999d3","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.758741Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:b124b3faa07edb18ef2600efec9d0b422802aec9e78d7237db26e11510ca39e0","observation_id":"b40eeff9-4701-49db-ab1d-f42fbb92e21c","resolution":{"observed_at":"2026-08-06T19:54:42.778194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.754192Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks,","venue":null,"work_id":"af96d21d-7aec-43a9-890a-e4307da65d43","year":2020},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.839156Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:5da7c4d45adbca0466d32f1648ec1813d903c4c0eeffb4409050ff9aaf41c043","observation_id":"21541f9a-325d-48c9-8b01-4df6ffe1a615","resolution":{"observed_at":"2026-08-06T19:54:42.759684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.734275Z","title":"Revive: Regional visual representation matters in knowledge-based visual question answering,","venue":null,"work_id":"9f8cf928-b673-42be-9e33-3f706ff949bb","year":2022},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.845567Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:b5496b21527003c614afb714b9c5d2c7a33d0968f615b86b8c5b884f083630c2","observation_id":"710d6250-ef31-4234-bfe7-764f87f9badd","resolution":{"observed_at":"2026-08-06T19:54:42.740514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.717358Z","title":"Medical visual question answering: A survey,","venue":null,"work_id":"914b53a2-5ee7-4b1c-94cc-12b7cf964d3b","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.850503Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:a4a579f8d848e355d021e782b531a4ad470ab930bf2c441adf60f6b44e69f997","observation_id":"72ba6c67-98ed-42ca-b63e-4123b107953e","resolution":{"observed_at":"2026-08-06T19:54:42.722596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.698956Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering,","venue":null,"work_id":"944f4e88-19b2-4fbf-8463-c66107176c41","year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.855310Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:d9423bb5d47d93f8dd1c95c41a8dd4ffe41cb70f3535162507c4a8c2d86322db","observation_id":"fb089f40-51d4-4c0a-bb68-89be47f4dbdc","resolution":{"observed_at":"2026-08-06T19:54:42.705226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.679533Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering,","venue":null,"work_id":"dbb60d11-0143-47c4-9b60-e2c9e3e24b77","year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.860397Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:e8a23a0a63422fde91dffa4e623d520e47fb01b5a7fffe5f288d15d57959e2fe","observation_id":"821c37c8-e4e6-4e84-9883-afb1bf2bccfe","resolution":{"observed_at":"2026-08-06T19:54:42.685304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-06T19:54:41.865463Z","title":"Efficient estimation of word representations in vector space,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.865463Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:6d188c85138c8e1c9a76c88237c825811676978baeb1f801d719ee390e877479","observation_id":"89d7ffc8-714c-48a7-b0a1-27b831079c4d","resolution":{"observed_at":"2026-08-06T19:54:41.865463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08704","last_updated":"2025-04-09T17:42:01Z","snapshot_observed_at":"2026-07-06T19:01:32.237848Z","submitted_at":"2024-08-16T12:32:44Z","title":"Beyond the Hype: A dispassionate look at vision-language models in medical scenario","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08704","snapshot_observed_at":"2026-08-06T19:54:41.871951Z","title":"Beyond the hype: A dis- passionate look at vision-language models in medical scenario,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.871951Z"},"links":{"cited_paper":"/paper/2408.08704","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:3439f1fdcc53b300785b9003bea79c3f8f761ea3ea7f6ad64a4da3388eb6c76d","observation_id":"b8127206-7314-425d-af16-acddf30e4f62","resolution":{"observed_at":"2026-08-06T19:54:41.871951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.661489Z","title":"K-pathvqa: Knowledge-aware multimodal representation for pathology visual question answering,","venue":null,"work_id":"cc526342-81d9-4195-92db-46e9cd744c91","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.877348Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:5729bec728e40d06f431ff0c3aea8cbd84cba5441f4440a87c8af66da587e04a","observation_id":"b4774f49-b889-499b-b9d0-9b830e42abf2","resolution":{"observed_at":"2026-08-06T19:54:42.666927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.642632Z","title":"Relation Extraction with Word Graphs from N-grams,","venue":null,"work_id":"629dd0bf-aa89-41d1-bcc8-a8ffd4a4311a","year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.883334Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:cc8733d457e293f705d864259c0c87fda6a86b517051d5f7923dbab789737afc","observation_id":"fd17081f-47fa-461e-ad15-2e96d563143b","resolution":{"observed_at":"2026-08-06T19:54:42.648583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.622307Z","title":"An improved attention for visual question answering,","venue":null,"work_id":"4fe7d1e6-c83a-4634-996a-b53c11071a9d","year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.890969Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:e636629e9c55fd0699c52cea67c5c1e0832985ef4ec4c510990f3b9ef4436eb6","observation_id":"770c0f31-edf0-40ab-8ef9-19e9eb9feb72","resolution":{"observed_at":"2026-08-06T19:54:42.629276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.601152Z","title":"Learning Word Representations with Regularization from Prior Knowledge,","venue":null,"work_id":"92385a03-2a2f-4407-a6db-2c6d228cfcff","year":2017},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.896806Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:0bc6119c6f297fafdb514a626416722450a4e2cbe1f74bc714fee663e5257ac6","observation_id":"148ae62c-5e42-49a0-bb31-065cdada7d89","resolution":{"observed_at":"2026-08-06T19:54:42.606857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:41.903392Z","title":"Complementary Learning of Word Em- beddings,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.903392Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:83fcb74121782e5011604e2a5bbfe262d805d187ab75c2c4ba474438b2195da4","observation_id":"4befd6a5-425a-48f1-a82f-efe8a053ba66","resolution":{"observed_at":"2026-08-06T19:54:41.903392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01279","last_updated":"2021-05-04T04:08:58Z","snapshot_observed_at":"2026-08-04T19:01:56.567591Z","submitted_at":"2021-05-04T04:08:58Z","title":"ZEN 2.0: Continue Training and Adaption for N-gram Enhanced Text Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01279","snapshot_observed_at":"2026-08-06T19:54:41.909167Z","title":"ZEN 2.0: Continue Training and Adaption for N-gram Enhanced Text Encoders,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.909167Z"},"links":{"cited_paper":"/paper/2105.01279","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:2d18b0f4aafed94013d59b14b7d0d32d86e09965ab73fc9ab1e5641b3c9b1a2b","observation_id":"488efb1a-27f0-4e35-ae39-7e62ebcce14d","resolution":{"observed_at":"2026-08-06T19:54:41.909167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-05T12:33:51.708082Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-06T19:54:41.914852Z","title":"VL- BERT: Pre-training of generic visual-linguistic representations,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.914852Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:5418455e7382ad372d077dee513d274bcdf018a0ee694b512b896a6fbdd358a8","observation_id":"3dc585b8-0a6b-48f3-bfa9-262fd14aee85","resolution":{"observed_at":"2026-08-06T19:54:41.914852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.568984Z","title":"ChiMed-GPT: A Chinese medical large language model with full training regime and better alignment to human preferences,","venue":null,"work_id":"f38fc7ed-fa75-4582-b54e-a2e730bf9b30","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.920856Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:6f4e933ee802aead205d6eb78f269258edd766fab336e0c8afd78a80a3e19974","observation_id":"e78a2eac-f36e-41f8-b89d-5a2ee88659d0","resolution":{"observed_at":"2026-08-06T19:54:42.574834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.549382Z","title":"Chimed: A chinese medical corpus for question answering,","venue":null,"work_id":"65bea780-ec38-4a72-8dc7-24d077c93e57","year":2019},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.926915Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:11070242a25b5b509a5b9ed61c5b29a55b523bfbcc2667dce60e972da9dcde0a","observation_id":"0202e505-99c1-498b-bbe1-cecb04b40914","resolution":{"observed_at":"2026-08-06T19:54:42.555078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19665","last_updated":"2025-06-24T14:29:06Z","snapshot_observed_at":"2026-08-06T23:03:03.927884Z","submitted_at":"2025-06-24T14:29:06Z","title":"Recurrent Visual Feature Extraction and Stereo Attentions for CT Report Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19665","snapshot_observed_at":"2026-08-06T19:54:41.933749Z","title":"Recurrent visual feature extraction and stereo attentions for ct report generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.933749Z"},"links":{"cited_paper":"/paper/2506.19665","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:66ff214e152893672c9c75c141ccb5e8b10f654a6cfb8e01970aef7995648e7b","observation_id":"867720fa-cb2a-42bc-b8c2-e00437be774d","resolution":{"observed_at":"2026-08-06T19:54:41.933749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.531433Z","title":"Supertagging Combinatory Categorial Grammar with Attentive Graph Convolutional Networks,","venue":null,"work_id":"78553f8b-22b1-4802-b7b5-3ff50a95a444","year":2020},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.941352Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:573fab110a49eac476aeb2fd22723d605c16cb35c072c8542c3e83b9ffe53354","observation_id":"b4ab7174-7f68-44d6-9f7a-88d57276949f","resolution":{"observed_at":"2026-08-06T19:54:42.536940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.511421Z","title":"Dialogue Summarization with Mix- ture of Experts based on Large Language Models,","venue":null,"work_id":"07eb16d4-a5b1-42a9-a2a4-faed80659b30","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.946962Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:bcaca532516f651435da5b5af007e1f35974848f5688eac107a3abb1352aa58c","observation_id":"de52edc8-5f81-4374-9404-9bc3dee63d54","resolution":{"observed_at":"2026-08-06T19:54:42.518424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.490085Z","title":"Diffusion networks with task-specific noise control for radiology report generation,","venue":null,"work_id":"4dc6b7c8-e85c-4833-93da-39bbff604c80","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.953143Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:138a60717f5157ad8d3890dbda72f3c214abeebc28c7a6e1e68910e88f7cefa9","observation_id":"63a2924d-a309-496b-98b9-688ae8d3b17f","resolution":{"observed_at":"2026-08-06T19:54:42.495824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.469385Z","title":"Learning multimodal contrast with cross-modal memory and reinforced contrast recognition,","venue":null,"work_id":"ee4de7c5-bf18-43e9-ae2d-5d31a9c79f54","year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.959504Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:1eb26ebcec3d7f0600704e0d3dfff521b80637ed46d61d42a3548d2ab92484b3","observation_id":"280cb60e-44f1-4dc4-bb1b-d84dfbd0a295","resolution":{"observed_at":"2026-08-06T19:54:42.476118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:54:41.966441Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.966441Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:ed0bddb0d7dc7bf071f0b11546f0c2d27d3571018422eef728ce20404e29bad0","observation_id":"6905bfd4-4f7f-46c7-9282-4b9daf92d9e5","resolution":{"observed_at":"2026-08-06T19:54:41.966441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.449656Z","title":"Open-ended medical visual question answering through prefix tuning of language models,","venue":null,"work_id":"8abe6662-cd55-4078-b96c-27e71ef99df2","year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.972313Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:961101e6eb78fe62b148b52eb7493f11408cc84db17a079fd50baa03da8596bc","observation_id":"7dee86f9-1c66-46fc-bd8b-cd9f2f4090c1","resolution":{"observed_at":"2026-08-06T19:54:42.455142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-06T19:54:41.978028Z","title":"Graph attention networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.978028Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:94cffa924777f72c2255b3bd2bc6aff731e633a68c94e3df1a7ce092238bd353","observation_id":"81c6e27b-9066-43dd-b03f-e3a08abc30a6","resolution":{"observed_at":"2026-08-06T19:54:41.978028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:54:41.985296Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.985296Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:e21db2ecc9c03733f446d4c400daa7de2aeddefc7fe37ded94f17290f100d896","observation_id":"f3e37c72-b1bf-4a66-addf-2a7da3fb9152","resolution":{"observed_at":"2026-08-06T19:54:41.985296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.430978Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text,","venue":null,"work_id":"c247957e-f373-499b-9018-df450cbee0a6","year":2022},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.991989Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:55f955e4a8e6e8c71633d7ff0c0db47a3e863975ebb707d25b34107fa79f486f","observation_id":"7666148e-657a-4fd3-88f8-2d53dcec53cb","resolution":{"observed_at":"2026-08-06T19:54:42.437037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-07T10:41:28.201668Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-06T19:54:41.997876Z","title":"To- wards generalist foundation model for radiology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:41.997876Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:200f06e5d1ad3567223e268409704c5dc5c2e4da1ea39b041bd8d8f29b7ccb1b","observation_id":"11cc7b50-8dfb-4230-b2e1-2ecc30e4b106","resolution":{"observed_at":"2026-08-06T19:54:41.997876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T19:54:42.003671Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:42.003671Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:ec770a7573bf8a015a19c8214a370a2ef06451483fc4b8de032f9ad9d41ca664","observation_id":"e315b091-23a7-4ebe-8bad-a4986323c8d1","resolution":{"observed_at":"2026-08-06T19:54:42.003671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-06T19:54:42.010528Z","title":"Pmc-vqa: Visual instruction tuning for medical visual question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:42.010528Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:58d13ecf75fbc2909beae3875b326e2ba659f44466ae0fcf38f9b017de217d31","observation_id":"07772605-64a3-477a-9f22-9b39bb5078b0","resolution":{"observed_at":"2026-08-06T19:54:42.010528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:42.410391Z","title":"When ra- diology report generation meets knowledge graph,","venue":null,"work_id":"16afbec6-68aa-440f-826f-937037fb58dd","year":2020},"citing_paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:42.017223Z"},"links":{"citing_paper":"/paper/2507.04333"},"observation_digest":"sha256:8050389c253792065709a230f702ead3a01f9739694880da41cb3860a6121d58","observation_id":"b41a2c6c-2110-48c7-86bc-9b115a446bc7","resolution":{"observed_at":"2026-08-06T19:54:42.417984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04333","last_updated":"2025-07-06T10:37:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T18:26:49.746805Z","submitted_at":"2025-07-06T10:37:16Z","title":"Computed Tomography Visual Question Answering with Cross-modal Feature Graphing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2507.04333."}