{"as_of":"2026-08-18T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:152cac8fbc1f0c6f80850a3c1cc042b99570562195b076b6f8a33e8d6bed45b6","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:47:50.268649Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15241/citation-record","integrity":"/paper/2607.15241/integrity","json":"/paper/2607.15241/citation-record.json","paper":"/paper/2607.15241"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:45.720994Z","title":"Medico 2025: Visual Question Answering for Gas- trointestinal Imaging,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:45.720994Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:9f66f9e60b875e93e051404f3a6aa84694fb67948d8e1f7e11c10c20cfe53a55","observation_id":"e4ebc507-d62e-44e1-bf94-5f791056258f","resolution":{"observed_at":"2026-08-01T23:47:45.720994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-032-08009-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kvasir- VQA-x1:A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy,","venue":"Lecture notes in computer science","work_id":"e68c22fc-1413-414d-8439-ee2f7d57d03f","year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:45.844349Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:6c29d094c29850e767d923d66721c3c32d3dd33bbc65dc65a0965b0fc20708e7","observation_id":"d16a7216-3a40-44fc-9818-4085e9660cdb","resolution":{"observed_at":"2026-08-01T23:48:20.137832Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:45.957189Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:45.957189Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:287d78c37fd4e850210f93c3863a931acee0209aa66344a8e765d614c8aac2d1","observation_id":"5dec4e0d-4588-455c-bb74-84a48943852c","resolution":{"observed_at":"2026-08-01T23:47:45.957189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.069256Z","title":"Qlora: efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.069256Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:070cc8c24d93c2e69c63919613eefe42e34031d65cdeda84f027876bcdfb9e08","observation_id":"a9dcffa5-4f19-4203-a93e-ec59e81f761d","resolution":{"observed_at":"2026-08-01T23:47:46.069256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.167259Z","title":"Parameter-Efficient Fine-Tuning Methods for Pretrained Language Models: A Critical Review and Assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.167259Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:602356d29849ba6461549dcd58f42832ca9fa7417c4b845757bb09bab3c850b1","observation_id":"26945d1b-331b-498f-8161-b968d2a1e030","resolution":{"observed_at":"2026-08-01T23:47:46.167259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.282042Z","title":"A Survey on Medical Large Language Models: Tech- nology, Application, Trustworthiness, and Future Directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.282042Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:437d72eb9874955e4c9bbda7b2abf90ea3ad2a61987bb8e0a9acf1853272c532","observation_id":"4f05b3ad-951d-4b70-a0a6-f6accc12d987","resolution":{"observed_at":"2026-08-01T23:47:46.282042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.428697Z","title":"VQA-Med: Overview of the medical visual ques- tion answering task at imageclef 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.428697Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:797656a7194addc2c1927422b6b6af9b32b5155f4372f5008b117b08e4bae450","observation_id":"da9bb747-cbe2-4829-9677-7b9f50b3bf53","resolution":{"observed_at":"2026-08-01T23:47:46.428697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.633914Z","title":"Medical visual question answering at imageclef-vqa med,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.633914Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:ece2f1410f7ae69536ad0fbe45a0d10ffd85593c8f70be459ba037e3816a030d","observation_id":"f643b1a8-7b63-49ad-9eb8-d0d57fb0216f","resolution":{"observed_at":"2026-08-01T23:47:46.633914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.734353Z","title":"Medical visual question answering: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.734353Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:c68bf9f110f480d2683443c10b6207bba8a636947508a9c26f119e04ec8a2dac","observation_id":"c5a89455-2369-4dff-9f7d-0e0ca65a1abb","resolution":{"observed_at":"2026-08-01T23:47:46.734353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:46.891922Z","title":"Overview of ImageCLEFmedical 2025– Visual Question Answering and Synthetic Image Generation for Gastrointestinal Tract,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:46.891922Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:fcae9c6d81e26626915a00adf537c6bf7cb7802a5142de49d5b8929b0a59156d","observation_id":"9151dd43-1ebb-4203-a109-1c10c3687e90","resolution":{"observed_at":"2026-08-01T23:47:46.891922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:47.102764Z","title":"Kvasir-VQA: A Text-Image Pair GI Tract Dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:47.102764Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:bec7e89e9239d47132aa9d344bff6319be1e09b9a60ce6c36e6a4658d753c788","observation_id":"5339cb1b-4d73-48f7-81ab-d46c12c1717d","resolution":{"observed_at":"2026-08-01T23:47:47.102764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:47.257062Z","title":"Exploring Vision-Language Models for Medical VQA on Gastrointestinal Images: A LoRA Fine-Tuning Study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:47.257062Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:210a72f948dc4917d24403976eb7eb129337efd0c55301ac4b23920454ccec92","observation_id":"5cd66580-afca-4f33-b966-b0ed6097ac59","resolution":{"observed_at":"2026-08-01T23:47:47.257062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:47.412718Z","title":"LoRA-Enhanced PaliGemma for Efficient Visual Question Answering in Gastrointestinal Imaging,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:47.412718Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:05d85cedfe9ddae7cd85c4fe1d4942560d802cfe2cd95878cedec798a07e2ff1","observation_id":"1d0c46b8-516a-4dcb-b199-cdff2161440a","resolution":{"observed_at":"2026-08-01T23:47:47.412718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:47.576978Z","title":"Multimodal Explanations: Justifying Decisions and Pointing to the Evidence,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:47.576978Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:4a25b2e0a5e4360630ae8425a47e55b272dff3875c49e0fd0f855ef043ded160","observation_id":"4d614b8a-4db9-48eb-91a6-cee613eb9f89","resolution":{"observed_at":"2026-08-01T23:47:47.576978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:47.742968Z","title":"Towards faithfully interpretable NLP systems: How should we define and evaluate faithfulness?","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:47.742968Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:19ff438bfebdd3f0235949b5d652edc8f2a683e27af3e289829a0e11265eb298","observation_id":"b1360515-aeb9-4a11-9ef2-c5df9b42e6f5","resolution":{"observed_at":"2026-08-01T23:47:47.742968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:47.856628Z","title":"Towards Faithful Model Explanation in NLP: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:47.856628Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:f631e97c77416cdd4ade83e79325cf8b605c3772a0c5573922ed5d8dd27b5675","observation_id":"ea716100-f6f1-4e61-a763-5206f7367ae0","resolution":{"observed_at":"2026-08-01T23:47:47.856628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.009591Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.009591Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:55a3ceca62f43ac1a1f944eccc7ede65353b114f1b65fbfc68a4323d7a11372d","observation_id":"bd9a8709-8a16-4e3c-88e5-016dfb7b7596","resolution":{"observed_at":"2026-08-01T23:47:48.009591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.150605Z","title":"From Answers to Explanations: Self-Probing Efficiently Fine-Tuned Vision-Language Models for Medical VQA at Medico 2025,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.150605Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:4f361f17b0c08f5beaae9f4c2162abb5c32bb3fa85cae557302410e15f088529","observation_id":"68ccbab9-1bf5-4d6f-b779-5f07e51735f3","resolution":{"observed_at":"2026-08-01T23:47:48.150605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.294746Z","title":"Curriculum-Guided Fine-Tuning for Multimodal VQA in GI Endoscopy (Team Lama4Vision),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.294746Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:1c87d6f61f2b4ce3c254e1bf5f153f553686037eba986b2730fab4841dd041b5","observation_id":"681e5945-f427-4ea2-ac2d-4f2a37530fb9","resolution":{"observed_at":"2026-08-01T23:47:48.294746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T23:47:48.399084Z","title":"Qwen3 Technical Report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.399084Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:b290dc619ef3774910f559313409717f97ca76ccb83ff1c7d6abd345f806723b","observation_id":"c5ca3c1e-3da0-492c-a78d-8d709f5d43aa","resolution":{"observed_at":"2026-08-01T23:47:48.399084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.480029Z","title":"Medico 2025: Visual Question Answering for Gastrointestinal Imaging,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.480029Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:91d19bcc1927a592d72f7bfc486ee2f4b157e982f1b0fe0a4abfc8447f934557","observation_id":"7236eafa-da93-4966-8f40-deb8c5dc4ebe","resolution":{"observed_at":"2026-08-01T23:47:48.480029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.556305Z","title":"ROUGE: A Package for Automatic Evaluation of Sum- maries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.556305Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:ea74ce359c034dd600d673a95994359330b6e330c36202f02f3472e6bd06b64f","observation_id":"493f3572-b12f-474c-9412-4f751380382f","resolution":{"observed_at":"2026-08-01T23:47:48.556305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.632097Z","title":"METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.632097Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:1557155e43de4ca2b1d5bff67fb95a4aebfaad07ae028b49972c5d9f7553bd8d","observation_id":"a82743ab-0539-45c4-9570-acededdcdc94","resolution":{"observed_at":"2026-08-01T23:47:48.632097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.711015Z","title":"chrF++: words helping character n-grams,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.711015Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:b60142f26af113b847f59031cd3453ca9d8998a218146def7f019f5226219f94","observation_id":"110fcc60-9559-4100-bdb4-b083f2e2a41b","resolution":{"observed_at":"2026-08-01T23:47:48.711015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.751684Z","title":"BLEU: a Method for Automatic Evaluation of Machine Translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.751684Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:9032573bdf7fb967b34307eb928e2a8210a5f221c406e49572e3a11357cbd8ab","observation_id":"6abbe02b-a3a5-43f5-82a6-6458c5dd0dff","resolution":{"observed_at":"2026-08-01T23:47:48.751684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.819943Z","title":"BERTScore: Evaluating Text Generation with BERT,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.819943Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:de78b8f4077c583cc5b9594143f2bd85ded9263c2c854a2d63ca4277c363ccce","observation_id":"24df5ea4-9ff7-43fc-aa81-9d2341311d4b","resolution":{"observed_at":"2026-08-01T23:47:48.819943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.903305Z","title":"Evaluate: A library for easily evaluating machine learn- ing models and datasets,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.903305Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:257d357f5c4219c386cb71e478b1422f4b5ed65ffcae9d11691feb47a7de8511","observation_id":"f988d8ec-5902-40a0-8837-923347d84bd7","resolution":{"observed_at":"2026-08-01T23:47:48.903305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:48.998530Z","title":"Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:48.998530Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:becedb071b3429a73582047704afca508be01641d91b31b8f9471b7782172c74","observation_id":"c0d5858b-8470-4f7e-bb7b-c91f24e72121","resolution":{"observed_at":"2026-08-01T23:47:48.998530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:49.080126Z","title":"Medico 2025: Visual Question Answering (with Multimodal Explanations) for Gastrointestinal Imaging,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.080126Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:83534ad52cf0eeded91c16ea570c602cf2a180425368e21361679b5178c74338","observation_id":"1bec4554-0cb9-4d1a-a21d-ea1453b008dd","resolution":{"observed_at":"2026-08-01T23:47:49.080126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:49.157256Z","title":"Enhancing Encoder-Decoder Architecture to Visual Question Answering Task for Gastrointestinal Images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.157256Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:636ffa729148255184e2e1a43dca22ad3dee522ba11aa1d95794dd0d4dabd0ff","observation_id":"3a0891e2-cfa0-4662-abf6-c849e2cb7fd8","resolution":{"observed_at":"2026-08-01T23:47:49.157256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:49.265736Z","title":"BLIP-2-based Visual Question Answering with Multimodal Explanations for Gastrointestinal Imaging,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.265736Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:1b0f3b157cceb66deda9db4133923bf566ff7896fb9ae6525a31ea1d7161220c","observation_id":"959a3a71-2560-4da1-9f26-fae5a11d93e7","resolution":{"observed_at":"2026-08-01T23:47:49.265736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:49.378765Z","title":"X-VQA for GI Diagnostics: Multimodal Visual Question Answering with Confidence-Aware Explanations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.378765Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:e15008a423504e3a6bd13f4ecda3baf2eafee47addf2f393580b7bafd78aa0f1","observation_id":"dc4b55f5-baa4-464c-9c54-7fe22d247155","resolution":{"observed_at":"2026-08-01T23:47:49.378765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06242","last_updated":"2023-11-10T18:59:08Z","snapshot_observed_at":"2026-08-18T09:41:20.936683Z","submitted_at":"2023-11-10T18:59:08Z","title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06242","snapshot_observed_at":"2026-08-01T23:47:49.460925Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.460925Z"},"links":{"cited_paper":"/paper/2311.06242","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:1504a468c101d9b7204d584dcf58ab05568b5492054762c107ce113a469904e1","observation_id":"01ce6139-da6c-4c35-be3f-bb35e21e2f5c","resolution":{"observed_at":"2026-08-01T23:47:49.460925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-01T23:47:49.538430Z","title":"Paligemma: A versatile 3b vlm for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.538430Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:da40f420619859a71c4ed4a2a9c091f9f8166909d06c5902368cebdfc87d37cd","observation_id":"0c948514-a116-437c-8b8f-0b9341fe9c28","resolution":{"observed_at":"2026-08-01T23:47:49.538430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-01T23:47:49.649987Z","title":"Paligemma 2: A family of versatile vlms for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.649987Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:7e403477749acfdf118a2004fc4a2fb207b0947bf441d7830d9d2d2f9f5f1411","observation_id":"21735fab-982d-4862-af1c-9ea6dc7c9c46","resolution":{"observed_at":"2026-08-01T23:47:49.649987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-01T23:47:49.734091Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.734091Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:2f92493c6b6d52576c6987e60abc03833b37616043fbb1d3d3ea3fcd8dd8cded","observation_id":"4c965876-d298-4e34-88c4-468c00889d1b","resolution":{"observed_at":"2026-08-01T23:47:49.734091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-01T23:47:49.798966Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.798966Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:1653841dade8631ae6f9625f31af2d187971a7da4a167010b832da53ecbf4c51","observation_id":"964f9428-2927-4230-98fd-36e4e4208916","resolution":{"observed_at":"2026-08-01T23:47:49.798966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T23:47:49.903613Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.903613Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:15e1c91548285c17a0efa44c7d0842fc05f71eae45a3fddfcd565c552aace32b","observation_id":"e52d2d06-c041-4263-afe5-8600e111f4ea","resolution":{"observed_at":"2026-08-01T23:47:49.903613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:49.994765Z","title":"Image Segmentation Using Text and Image Prompts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:49.994765Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:8fc9d5dc0fcbb72096728390e6d8efae127b3a1d84843cd8a7d4b13c058e08b1","observation_id":"edd60e04-6a9a-4b1d-a3df-b01248df2e21","resolution":{"observed_at":"2026-08-01T23:47:49.994765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:50.067973Z","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:50.067973Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:5e7100ddc9b4e86cb7998eb3492e8f089ec7b5dca6c857cb72f4f5e87cac9f7c","observation_id":"8429f8ad-901e-4982-a43f-f08385b01322","resolution":{"observed_at":"2026-08-01T23:47:50.067973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:50.149119Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:50.149119Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:c50b8203e54ee142137d9a78b9e311486d581562825bdf4896a5d29ed642d8d7","observation_id":"120f8509-c27b-444f-b5f5-9c9a2c5543c4","resolution":{"observed_at":"2026-08-01T23:47:50.149119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:50.203408Z","title":"Curriculum Learning: A Survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:50.203408Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:d9fcc641e9f3987cb284b97bd259516c445c64481122c0356c9523b8d1ef80ed","observation_id":"20d0c7a3-558b-4114-a3c7-48f4f355eed8","resolution":{"observed_at":"2026-08-01T23:47:50.203408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:47:50.268649Z","title":"LLM-FP4: 4-bit floating-point quantized transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T23:47:50.268649Z"},"links":{"citing_paper":"/paper/2607.15241"},"observation_digest":"sha256:ab50c83e20c0842b3820befd4967da52975056b70d68867f3f2cee3cd6f8908e","observation_id":"aaa4a646-4320-4ef4-a2f7-34572a60d652","resolution":{"observed_at":"2026-08-01T23:47:50.268649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15241","last_updated":"2026-07-16T17:38:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T09:42:28.895230Z","submitted_at":"2026-07-16T17:38:19Z","title":"Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.15241."}