{"as_of":"2026-08-06T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9a02978903b740eef2ffdb046ac56068e5f544a43f129fd7c03b981c9f16bc6","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:43:33.938358Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09142/citation-record","integrity":"/paper/2607.09142/integrity","json":"/paper/2607.09142/citation-record.json","paper":"/paper/2607.09142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:25.688712Z","title":"Digital health market statistics 2026: Market size, investment and user adoption, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:25.688712Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:7123e73ad25c0781407a04b274e3a30b5b5a4a53e4632989b5477fd31a5ea314","observation_id":"6a1ad8a4-881d-46b2-8649-94a2b439bebc","resolution":{"observed_at":"2026-08-02T07:43:25.688712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:25.786509Z","title":"Telemedicine and AI in healthcare: Top platforms, trends & 2026 outlook","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:25.786509Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:b1e466ab731fe2b930ecfddbd2c8a14a6f14782160150519e2d2a37c8aed4828","observation_id":"eee4d6a4-b9de-4afc-ae16-2833153e5602","resolution":{"observed_at":"2026-08-02T07:43:25.786509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:25.910724Z","title":"Annual results announcement for the year ended december 31, 2025.HKEXnews,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:25.910724Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:10dd60424fc7c6f76d32d7ce8ac40f657831c8e9c6a0f0721b13351ca95ecdac","observation_id":"876d928c-fc1c-4adf-9ce4-4963652761ec","resolution":{"observed_at":"2026-08-02T07:43:25.910724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.122716Z","title":"Jd health introduces groundbreaking LLM-powered suite for comprehensive online and in-hospital healthcare scenarios","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.122716Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:ced0c121d1a3a02d20912e048602494e07ed4a8809b417473f4b8e639d1a8bbf","observation_id":"73599099-f7c4-40ec-b3a6-f37940c1d36d","resolution":{"observed_at":"2026-08-02T07:43:26.122716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.257849Z","title":"Large language models in medicine.Nature Medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.257849Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:f913b7a10367852f035a078573466af6e803a645f609c35ea72cef64a0dbbd4f","observation_id":"ff60bbc3-5ecb-4029-8655-37e3fc8bcbc0","resolution":{"observed_at":"2026-08-02T07:43:26.257849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.413588Z","title":"The effect of using a large language model to respond to patient messages.The Lancet Digital Health, 6(6):e379–e381, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.413588Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:0401848c3bb5b66a146ca36183febfdab55c9153e75ae416aea275bf57645c1e","observation_id":"432496d1-5fcf-4220-99ca-6085f0d7f763","resolution":{"observed_at":"2026-08-02T07:43:26.413588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.523483Z","title":"Sara Mahdavi, Sushant Prakash, Anupam Pathak, Christopher Semturs, Shwetak Patel, Dale R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.523483Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:176f989d915442d0fbafd0bc22a140dfd058d3b610baab529cba4ea289139db5","observation_id":"181fbc43-a92c-4a1f-afac-30ed9ebc589b","resolution":{"observed_at":"2026-08-02T07:43:26.523483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-07-06T08:21:28.880621Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-02T07:43:26.664483Z","title":"Cohen, and Xinghua Lu","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.664483Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:468640e76133719b21a39629d2a34aaa12b92b82de94e0281417bd0acea64943","observation_id":"0918ed26-4579-4a86-a3b7-4623dd1e138a","resolution":{"observed_at":"2026-08-02T07:43:26.664483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-06T03:17:52.286711Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-02T07:43:26.823891Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.823891Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:8bce0e5dcb5e3c2d4483ccc9a2b74baec024a2602cecbda77dcc03cf65d38959","observation_id":"e177c21c-8e1e-4394-a07f-0a66afc3b90b","resolution":{"observed_at":"2026-08-02T07:43:26.823891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-07-06T12:52:58.991468Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-02T07:43:26.937401Z","title":"MedMCQA: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.937401Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:77ffc959e6719a85bdb38ced82c22fb8e11d145c67a738d17f7d1736de05826f","observation_id":"183fe46d-a841-4df4-9fc0-51fcf547f4ae","resolution":{"observed_at":"2026-08-02T07:43:26.937401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13138","last_updated":"2022-12-26T14:28:24Z","snapshot_observed_at":"2026-07-06T14:35:02.598037Z","submitted_at":"2022-12-26T14:28:24Z","title":"Large Language Models Encode Clinical Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13138","snapshot_observed_at":"2026-08-02T07:43:27.075346Z","title":"Sara Mahdavi, Jason Wei, Hyung Won Chung, Nathan Scales, Ajay Tanwani, Heather Cole-Lewis, Stephen Pfohl, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.075346Z"},"links":{"cited_paper":"/paper/2212.13138","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:3da01e2fc77c0d29c691938d1f2f76e5d50186f5231e6ceed38d25b78e1d4a08","observation_id":"f508afda-9752-4fa1-aa52-4d8214ec7c63","resolution":{"observed_at":"2026-08-02T07:43:27.075346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-02T07:43:27.233202Z","title":"Pfohl, Heather Cole-Lewis, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.233202Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:edc9feadb763ee02c9aa2984b366cd5b3127ce82b6e81a05418bc69853e8c9db","observation_id":"1870a552-4732-4b07-9ad8-5c25893fe155","resolution":{"observed_at":"2026-08-02T07:43:27.233202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08087","last_updated":"2022-03-07T09:14:20Z","snapshot_observed_at":"2026-08-01T20:36:18.568223Z","submitted_at":"2021-06-15T12:25:30Z","title":"CBLUE: A Chinese Biomedical Language Understanding Evaluation Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08087","snapshot_observed_at":"2026-08-02T07:43:27.362450Z","title":"CBLUE: A chinese biomedical language understanding evaluation benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.362450Z"},"links":{"cited_paper":"/paper/2106.08087","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:8db6036f6a88f1e74f11d97bdeebeccfb61f94a25735ec0518284be6e28517c2","observation_id":"fbb0743a-4cbf-4d02-9609-232b224dcf38","resolution":{"observed_at":"2026-08-02T07:43:27.362450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14151","last_updated":"2023-10-22T02:20:38Z","snapshot_observed_at":"2026-08-05T23:12:49.134878Z","submitted_at":"2023-10-22T02:20:38Z","title":"PromptCBLUE: A Chinese Prompt Tuning Benchmark for the Medical Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14151","snapshot_observed_at":"2026-08-02T07:43:27.511156Z","title":"PromptCBLUE: A chinese prompt tuning benchmark for the medical domain","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.511156Z"},"links":{"cited_paper":"/paper/2310.14151","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:91e8616876b1bb8f514b4856e76fb098d6dc275aa84cb1b2263fc81526145cbb","observation_id":"c0434527-5519-4fc2-b6b4-94de581d78a6","resolution":{"observed_at":"2026-08-02T07:43:27.511156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03030","last_updated":"2023-10-23T02:55:08Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T16:48:41Z","title":"Benchmarking Large Language Models on CMExam -- A Comprehensive Chinese Medical Exam Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03030","snapshot_observed_at":"2026-08-02T07:43:27.681801Z","title":"Benchmarking large language models on CMExam – a comprehensive chinese medical exam dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.681801Z"},"links":{"cited_paper":"/paper/2306.03030","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:0b6f285b3bfd3609f49d9fe179e4744c054478d3d902c5e2405178eda23b1ea8","observation_id":"8294e180-58e9-43c2-a5cb-53108082f788","resolution":{"observed_at":"2026-08-02T07:43:27.681801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08833","last_updated":"2024-04-04T15:16:57Z","snapshot_observed_at":"2026-07-06T16:07:10.648879Z","submitted_at":"2023-08-17T07:51:23Z","title":"CMB: A Comprehensive Medical Benchmark in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08833","snapshot_observed_at":"2026-08-02T07:43:27.798869Z","title":"CMB: A comprehensive medical benchmark in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.798869Z"},"links":{"cited_paper":"/paper/2308.08833","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:8b8846704ef1b2ff21042dc25643d8994a56d916af1932bcb092e226fdd11aea","observation_id":"0b73336c-7c26-4e88-b773-3f6ccf58c482","resolution":{"observed_at":"2026-08-02T07:43:27.798869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10990","last_updated":"2024-06-24T02:25:48Z","snapshot_observed_at":"2026-08-05T14:38:16.803841Z","submitted_at":"2024-06-24T02:25:48Z","title":"MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10990","snapshot_observed_at":"2026-08-02T07:43:27.951292Z","title":"MedBench: A comprehensive, standardized, and reliable benchmarking system for evaluating chinese medical large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.951292Z"},"links":{"cited_paper":"/paper/2407.10990","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:1b9a2848e6c8e853bdee58f277691c6f28c794e35fe0d343aae1a05164e8b715","observation_id":"cde0045c-0945-4411-bed9-9f84f6eb9ca6","resolution":{"observed_at":"2026-08-02T07:43:27.951292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:28.100984Z","title":"MedBench v4: A robust and scalable benchmark for evaluating chinese medical language models, multimodal models, and intelligent agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.100984Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:23c18354c53c992fbe2116bac810d951f10b0f3645434161a6c39a7e98562759","observation_id":"9341c942-ee09-4468-99a3-3675518a7e40","resolution":{"observed_at":"2026-08-02T07:43:28.100984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03329","last_updated":"2020-07-07T22:15:10Z","snapshot_observed_at":"2026-07-31T20:43:02.793178Z","submitted_at":"2020-04-07T13:07:09Z","title":"MedDialog: Two Large-scale Medical Dialogue Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03329","snapshot_observed_at":"2026-08-02T07:43:28.248603Z","title":"MedDialog: Two large-scale medical dialogue datasets","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.248603Z"},"links":{"cited_paper":"/paper/2004.03329","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:fdddbc24d1a32d83034cbeac81e4a211c2d492badf327d2fecd72bf112f345b7","observation_id":"462b7725-9db1-45be-a48c-cc1c18e7da5d","resolution":{"observed_at":"2026-08-02T07:43:28.248603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07497","last_updated":"2022-07-31T06:04:16Z","snapshot_observed_at":"2026-07-06T10:04:39.356284Z","submitted_at":"2020-10-15T03:34:33Z","title":"MedDG: An Entity-Centric Medical Consultation Dataset for Entity-Aware Medical Dialogue Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07497","snapshot_observed_at":"2026-08-02T07:43:28.362118Z","title":"MedDG: An entity-centric medical consultation dataset for entity-aware medical dialogue generation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.362118Z"},"links":{"cited_paper":"/paper/2010.07497","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:a543313f5fc0e4f1e55cc677ffa690b1f9e2a66ad9cc29d7dcbdc12890e9002e","observation_id":"d7c0bf2f-8490-46d8-a4f5-388493ca024b","resolution":{"observed_at":"2026-08-02T07:43:28.362118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14204","last_updated":"2024-10-18T06:38:22Z","snapshot_observed_at":"2026-07-06T19:35:48.603411Z","submitted_at":"2024-10-18T06:38:22Z","title":"MediTOD: An English Dialogue Dataset for Medical History Taking with Comprehensive Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14204","snapshot_observed_at":"2026-08-02T07:43:28.563988Z","title":"MediTOD: An english dialogue dataset for medical history taking with comprehensive annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.563988Z"},"links":{"cited_paper":"/paper/2410.14204","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:b40f7d485b4cea9d558b8229a3e7b5ac88e4d11fbf82b7fa066d9c1acef29d78","observation_id":"ed20a62f-3db0-48d9-9903-f9a7e420320e","resolution":{"observed_at":"2026-08-02T07:43:28.563988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02077","last_updated":"2023-09-05T09:24:48Z","snapshot_observed_at":"2026-08-05T03:39:32.701960Z","submitted_at":"2023-09-05T09:24:48Z","title":"An Automatic Evaluation Framework for Multi-turn Medical Consultations Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02077","snapshot_observed_at":"2026-08-02T07:43:28.746413Z","title":"An automatic evaluation framework for multi-turn medical consultations capabilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.746413Z"},"links":{"cited_paper":"/paper/2309.02077","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:34e48a340211d62d71f46416bda1b0d0e0fbfe5ff2afcc92c48231195ca67ea7","observation_id":"e3f088dc-644e-4366-b52e-6ba78e64699b","resolution":{"observed_at":"2026-08-02T07:43:28.746413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00922","last_updated":"2024-11-07T18:59:30Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T01:32:52Z","title":"MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00922","snapshot_observed_at":"2026-08-02T07:43:28.926838Z","title":"Ilgen, Emma Pierson, Pang Wei Koh, and Yulia Tsvetkov","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.926838Z"},"links":{"cited_paper":"/paper/2406.00922","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:de250262f43ca816b85842fc1da93d04b968d9185c6b034fdb45e45e01983363","observation_id":"310599d4-a556-4d3c-9593-20d0146ef02c","resolution":{"observed_at":"2026-08-02T07:43:28.926838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07960","snapshot_observed_at":"2026-08-02T07:43:29.119519Z","title":"AgentClinic: A multimodal agent benchmark to evaluate ai in simulated clinical environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.119519Z"},"links":{"cited_paper":"/paper/2405.07960","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:dbbce049b0336d7085b22f5f3c6065c6ee6b725cd2156c5f1c03101d511c4c75","observation_id":"3979da11-9bc2-4c55-992e-7e00b5a2271c","resolution":{"observed_at":"2026-08-02T07:43:29.119519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.236433Z","title":"The dialogue that heals: A comprehensive evaluation of doctor agents’ inquiry capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.236433Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:9fb013273acb1b85df6c2a8615a0094c87f7b3e4da1c00b954a2d7f7ed7ec4d8","observation_id":"e5d4cf8c-894c-4615-ac3a-d8e70632fee0","resolution":{"observed_at":"2026-08-02T07:43:29.236433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.366837Z","title":"MedConsultBench: A full-cycle, fine-grained, process-aware benchmark for medical consultation agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.366837Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:12d4b1f4a8ff9121db8cad3b0ec7f8e51804930334a7332596d9be420a6dd7ee","observation_id":"ad75dbaa-267b-446c-91a2-c19939d35b20","resolution":{"observed_at":"2026-08-02T07:43:29.366837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06846","last_updated":"2026-04-08T09:09:08Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:09:08Z","title":"MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06846","snapshot_observed_at":"2026-08-02T07:43:29.543299Z","title":"MedDialBench: Benchmarking llm diagnostic robustness under parametric adversarial patient behaviors","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.543299Z"},"links":{"cited_paper":"/paper/2604.06846","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:3b6cf51e1dbfde5d48ce1d7268e940942964d512f943dfb1ae69bd8ad6125a69","observation_id":"b918b6c6-5b1a-485e-a607-543c27840528","resolution":{"observed_at":"2026-08-02T07:43:29.543299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-02T07:43:29.669791Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.669791Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:ca1f0fb02e33d3f950e3280135635909d53932c921c73faefddb56ebc68f68ed","observation_id":"5c28d1b3-da97-4557-b02f-1ee05f199559","resolution":{"observed_at":"2026-08-02T07:43:29.669791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.782033Z","title":"MedDialogRubrics: A comprehensive benchmark and evaluation framework for multi-turn medical consultations in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.782033Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:10e92aa3c45bbfe048870c6cfd8c89752ec86760a0490290a996acbf57781462","observation_id":"a3b41ff3-cf2a-498a-841c-860de381de38","resolution":{"observed_at":"2026-08-02T07:43:29.782033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27470","last_updated":"2026-04-30T06:13:01Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:13:01Z","title":"HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27470","snapshot_observed_at":"2026-08-02T07:43:29.880526Z","title":"Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.880526Z"},"links":{"cited_paper":"/paper/2604.27470","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:4d00ba7fa68e2c373aa1cab1d0898702e4cf234571e022170d1ffae4c80d705e","observation_id":"03862263-cc3a-4a61-8712-b34e585cd437","resolution":{"observed_at":"2026-08-02T07:43:29.880526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.950426Z","title":"LiveMedBench: A contamination-free medical benchmark for llms with automated rubric evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.950426Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:ee24a536b04d7fd30e306f246d7fe23d73ab7c29d00a460ede08833178594c2f","observation_id":"e3c44edf-094f-4393-b43d-1117baa87024","resolution":{"observed_at":"2026-08-02T07:43:29.950426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12435","last_updated":"2020-10-06T00:36:55Z","snapshot_observed_at":"2026-08-02T06:31:20.270994Z","submitted_at":"2020-10-06T00:36:55Z","title":"Pathological Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12435","snapshot_observed_at":"2026-08-02T07:43:30.054286Z","title":"Pathological visual question answering","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.054286Z"},"links":{"cited_paper":"/paper/2010.12435","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:aa3316f7d5139b0ca0c712d9fba8fe4242c92aa2c3182d832517b8deabc3deac","observation_id":"ba18ef32-8a30-44b3-8a64-c2b74b4e3b4e","resolution":{"observed_at":"2026-08-02T07:43:30.054286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09542","last_updated":"2021-02-18T18:44:50Z","snapshot_observed_at":"2026-08-05T10:02:06.651858Z","submitted_at":"2021-02-18T18:44:50Z","title":"SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09542","snapshot_observed_at":"2026-08-02T07:43:30.225146Z","title":"SLAKE: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.225146Z"},"links":{"cited_paper":"/paper/2102.09542","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:ed53db358a20bc0e2090ecc374793b2d64eea0b9f3cd0be9b85dedf3b5d50ab8","observation_id":"369af46b-79f9-4318-a36d-a07bcb501226","resolution":{"observed_at":"2026-08-02T07:43:30.225146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-02T07:43:30.424951Z","title":"PMC-VQA: Visual instruction tuning for medical visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.424951Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:570ae928f0790ea70be2fa92e77faecc5dbcd815ed11a670e26aa2d91cfd4d39","observation_id":"f258a7b8-4738-47c0-b000-21122bbb8a47","resolution":{"observed_at":"2026-08-02T07:43:30.424951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09181","last_updated":"2024-04-21T09:51:58Z","snapshot_observed_at":"2026-07-06T17:30:00.589378Z","submitted_at":"2024-02-14T13:51:56Z","title":"OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09181","snapshot_observed_at":"2026-08-02T07:43:30.666324Z","title":"OmniMedVQA: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.666324Z"},"links":{"cited_paper":"/paper/2402.09181","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:8454d10002ff4dcf0eb167753eb47ba495ee71292356abc41794237bb4b6e0b7","observation_id":"b3bd1d15-802d-4ec8-9978-b111521d6969","resolution":{"observed_at":"2026-08-02T07:43:30.666324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03361","last_updated":"2024-10-21T04:26:41Z","snapshot_observed_at":"2026-07-06T18:57:35.353383Z","submitted_at":"2024-08-06T17:59:21Z","title":"GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03361","snapshot_observed_at":"2026-08-02T07:43:30.865915Z","title":"GMAI-MMBench: A comprehensive multimodal evaluation benchmark towards general medical ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.865915Z"},"links":{"cited_paper":"/paper/2408.03361","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:24677b4c77f40bceaf2e896d00694c46e13f7a085219762aca874f8b0dba96d8","observation_id":"3021863a-813b-46d5-95f9-a8515395b7e7","resolution":{"observed_at":"2026-08-02T07:43:30.865915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.006709Z","title":"3MDBench: Medical multimodal multi-agent dialogue benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.006709Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:d8b5fb6d680707f542378b55c0c88e1987dc33ebcab97b307c3d1a5322c27e77","observation_id":"3b39bde9-9457-408e-8b54-358d48810fcd","resolution":{"observed_at":"2026-08-02T07:43:31.006709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.110964Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.110964Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:7a96ababa6d1697d16ff7ac84f92c35a4814056d7a2de700840895ae459e4437","observation_id":"354b8dcf-1fa4-42c8-97f1-151abf94012e","resolution":{"observed_at":"2026-08-02T07:43:31.110964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.410371Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.410371Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:924b0838edcc5bb1b6548901a43f00547322dd71b33f21981c099028670c556c","observation_id":"d18b794b-8000-48aa-b3d7-4d279717bb7b","resolution":{"observed_at":"2026-08-02T07:43:31.410371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-07-06T22:42:36.961014Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15161","snapshot_observed_at":"2026-08-02T07:43:31.569388Z","title":"Rahmani, and Emine Yilmaz","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.569388Z"},"links":{"cited_paper":"/paper/2601.15161","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:32754ebd1b92e4e00c8113a1e27a74817ff6b3556d5faccd95e076dead6f9ed5","observation_id":"06ee9cf1-7695-493b-bb5d-11eacaead115","resolution":{"observed_at":"2026-08-02T07:43:31.569388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.765489Z","title":"Deid-gpt: Zero-shot medical text de-identification by gpt-4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.765489Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:1af986e0714ae7bddda8fbda9a7c384456edb810540b2c5f268051a0eee55176","observation_id":"c2fb55a3-c897-4da8-a337-a77d5b0a6f0d","resolution":{"observed_at":"2026-08-02T07:43:31.765489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-02T07:43:31.943930Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.943930Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:f8c07d7e97123d99408f2f5f12a972b43f670905e15dbfc14738b6f96fff7eda","observation_id":"c416349b-22aa-4f58-9327-06a7940f1254","resolution":{"observed_at":"2026-08-02T07:43:31.943930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.184738Z","title":"Claude 4 Opus (versions 4.6 and 4.7)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.184738Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:fef064dc670cfddef365cf1a95a98d8e9c10b8d36aea71d98185159f1be8cecc","observation_id":"b4e77de7-b0ea-483e-b1da-89d4c3ce8286","resolution":{"observed_at":"2026-08-02T07:43:32.184738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T07:43:32.274199Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.274199Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:97dde6ed8185950f4a5137c217d0aec46ebed9c9e88f090d06b433cd06d913e3","observation_id":"f335b87c-5989-4339-99ad-8c944f2be03d","resolution":{"observed_at":"2026-08-02T07:43:32.274199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.428880Z","title":"Evaluation and mitigation of the limitations of large language models in clinical decision-making.Nature Medicine, 30(9):2613–2622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.428880Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:0cc329cbbce56ab99c1adcb0b7ec2e7f52621c7c08e516123c4c0c352eaa1c58","observation_id":"4477c2c2-fcd2-49a8-b58b-b394231ec60b","resolution":{"observed_at":"2026-08-02T07:43:32.428880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.524263Z","title":"Computing inter-rater reliability and its variance in the presence of high agreement.The British Journal of Mathematical and Statistical Psychology, 61(Pt 1):29–48, May 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.524263Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:40a65a83fdef24eb4b9adb895e2213b511dba5947e559bb09fd283923bd70f78","observation_id":"8e2217cf-6a56-44d0-a323-8ebf1191b520","resolution":{"observed_at":"2026-08-02T07:43:32.524263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T07:43:32.654513Z","title":"Openai gpt-5 system card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.654513Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:6e0069e25fc30ca6b63884ee03362c23d191773ea03e31569d50029954e7fdbb","observation_id":"4483cad1-d5f7-449f-9481-80bd33ee5731","resolution":{"observed_at":"2026-08-02T07:43:32.654513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.828616Z","title":"Kimi K2.6: Open-weight trillion-parameter MoE agent model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.828616Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:7d182307ee6a1ea4103d45c60694e9f1dd0c237a67f3a4d263e463065b790bc3","observation_id":"e264408a-9830-4863-818a-3dbf2d558523","resolution":{"observed_at":"2026-08-02T07:43:32.828616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-02T07:43:32.919875Z","title":"Kimi k2.5: Visual agentic intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.919875Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:75b13087681bbbd35c87b9c9533ecc4c21a9def8d1b709758d1fcb46fb724a01","observation_id":"afe5a4f5-1d7d-4b54-98e0-74245ae93649","resolution":{"observed_at":"2026-08-02T07:43:32.919875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.082950Z","title":"Qwen3.6-27B and Qwen3.6-35B-A3B","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.082950Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:c0e3cd34931355ba1a5e502bd1047038ab288726d55224e34efc46acf9779200","observation_id":"970a2151-1b35-43bd-97e3-5f929883a890","resolution":{"observed_at":"2026-08-02T07:43:33.082950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-02T07:43:33.163310Z","title":"Glm-5: from vibe coding to agentic engineering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.163310Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:dae0ae4cfa4f6bd987ea865c6aaa0779c4559957981237215dddb077c3279633","observation_id":"0082b4cb-43a1-4ea4-952d-5adb8e7403fc","resolution":{"observed_at":"2026-08-02T07:43:33.163310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.294868Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.294868Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:4854c9a19fd43e177c7d4d4c4db78abd6f5ce3120924db6f5be78e91aaf2ae81","observation_id":"b5a2e2d9-9b8f-414f-9671-8936850fe550","resolution":{"observed_at":"2026-08-02T07:43:33.294868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05201","last_updated":"2026-04-06T19:50:20Z","snapshot_observed_at":"2026-08-02T22:39:49.756195Z","submitted_at":"2025-07-07T17:01:44Z","title":"MedGemma Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05201","snapshot_observed_at":"2026-08-02T07:43:33.376539Z","title":"Medgemma technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.376539Z"},"links":{"cited_paper":"/paper/2507.05201","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:1fb7b1b0b4d86fe944eb31a32d92c975ce1847c6dbb564a43b2b847215eec221","observation_id":"6913a623-f7c6-4faa-a95e-6d8849a9926b","resolution":{"observed_at":"2026-08-02T07:43:33.376539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07044","last_updated":"2025-06-13T04:22:02Z","snapshot_observed_at":"2026-07-06T21:38:34.998414Z","submitted_at":"2025-06-08T08:47:30Z","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07044","snapshot_observed_at":"2026-08-02T07:43:33.468367Z","title":"Lingshu: A generalist foundation model for unified multimodal medical understanding and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.468367Z"},"links":{"cited_paper":"/paper/2506.07044","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:d890a50cc40d3577f81b102aed137996d02805c9abf9c1334978e8097b2a9bf9","observation_id":"6a4e171b-9759-4461-9e21-9b52c520e620","resolution":{"observed_at":"2026-08-02T07:43:33.468367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.592310Z","title":"HuatuoGPT-3-32B large language model repository","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.592310Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:2b3bcbf81f5fc4a841efe5812d1bb886903dec827ef21d39ad74a31852f58e6f","observation_id":"36c637cd-853b-4147-8cb6-3d6cbb375d55","resolution":{"observed_at":"2026-08-02T07:43:33.592310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.700922Z","title":"AntAngelMed medical large language model repository","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.700922Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:76dde89bc8566376e5d970fb358db299cff09b772d9a82192b9aada40b71e07a","observation_id":"d7d60289-1b8a-44f2-825d-fb59cdb324b6","resolution":{"observed_at":"2026-08-02T07:43:33.700922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.813874Z","title":"Baichuan-m3: Modeling clinical inquiry for reliable medical decision-making","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.813874Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:f427cd30044429f422c0241e9c7f17ff64ffdb408cff085c040868674bd463c7","observation_id":"b90d72ee-6280-46d1-ae02-f1cfaf8a4bf7","resolution":{"observed_at":"2026-08-02T07:43:33.813874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-05T11:50:10.014003Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02208","snapshot_observed_at":"2026-08-02T07:43:33.938358Z","title":"criterion_id","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.938358Z"},"links":{"cited_paper":"/paper/2509.02208","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:33affeb450500e0c6b6eb4cf3341c4d689bbde191f67dd534a829e12ff0ef445","observation_id":"43ace38b-6942-4848-ac4b-abb59379089c","resolution":{"observed_at":"2026-08-02T07:43:33.938358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.271033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.271033Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:094b0908b7e4c8405bb70a4c35fb95596735575cacd3ac8ecfc98f25b60a1147","observation_id":"d307073a-6f3b-4733-b603-53b7b3bc5a33","resolution":{"observed_at":"2026-08-02T07:43:31.271033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.014553Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.014553Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:ee499ea8002fceadb3f3b0a742a7a0670ed9340d761039f6db3e48b66fc76728","observation_id":"a08c4839-7f50-40b1-8dca-8061cac79deb","resolution":{"observed_at":"2026-08-02T07:43:26.014553Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T21:24:41.812527Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2607.09142."}